AI Pulse
🔥 热点深度解读

谷歌DeepMind搞出了AI评估的行业新玩法

有人给闭源AI测安全性,连评测方都看不到模型核心。

这是行业第一次这样的尝试,由Google DeepMind和独立机构AVERI共同完成。

所谓双盲评估,就是搭建一个安全环境,评测用的测试问题和闭源模型的核心参数都不会互相暴露,评测结果却能保证有效。Google DeepMind称这是行业首创的试点项目,目的是让第三方对模型的安全和性能评估,能同时满足隐私保护、结果可靠和值得信任三个要求。

现在前沿AI市场已经分成了三个方向:控制智能访问权、完全开放模型权重、给模型分配对应任务,闭源专有模型仍然在能力前沿占据主导地位。

闭源模型因为不公开核心参数,第三方一直很难做独立的安全评估;而开放权重的模型,又普遍在滥用风险的安全评分上表现更低。

@GoogleDeepMind 认为:这种方式可以让外部对我们模型的安全和性能评估,保持隐私、可靠和可信任。

@AVERIorg 认为:这是一个历史性里程碑,是第一次对专有语言模型完成双盲评估。

现在大家已经达成共识,前沿AI因为潜在风险,可能需要比普通AI更严格的安全标准。但之前独立评测要么拿不到模型核心,要么会泄露闭源模型的隐私,一直没有两全的方案。

这次的试点相当于开出了一条新路:第三方不用拿到完整模型,也能给出可信的安全结论;闭源模型不用公开核心,也能证明自己的安全性。

接下来,其他闭源模型开发者会跟进这套方案吗?

📎 参考来源

查看原始推文

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新