AVERI, Google DeepMind, OpenMined, MLCommons发布Gemini 2.5 Flash-Lite 双盲安全性评估结果(2024)
今天我们宣布一个历史性里程碑:首个针对闭源语言模型的双盲评估。本次评估由AVERI、@GoogleDeepMind、@OpenMinedOrg与@MLCommons通过独特合作实现。
我们在安全飞地(一种保护敏感计算的硬件隔离技术)中,使用MLCommons安全基准系列AILuminate中从未公开过的prompt测试了Gemini 2.5 Flash-Lite。参与的每个机构都发挥了独特作用,才得以实现强有力的隐私保障。
高风险独立评估存在一个结构性问题:开发者和评估方都持有需要保护的资产。开发者分享模型权重会面临被盗和泄露的风险。评估方如果发布基准或将基准直接提供给企业,可能会被企业拿来针对性训练,基准就会失去独立性。
安全飞地解决了这一限制。在双方资产进入飞地前,硬件会准确证明将要运行的代码是什么,双方都会审核并批准该代码。随后飞地执行代码,只向约定接收方释放约定输出。
OpenMined、@Anthropic和@AISecurityInst在2024年完成的试点已经证明了这套机制,当时使用GPT-2作为替代,做了五行评估。我们今天宣布的本次试点,已经推进到生产级模型和更全面的评估。
AVERI使用只有自己能接触到的私钥加密prompt,随后AVERI和Google DeepMind在Google配置的飞地环境中,使用OpenMined最初开发并调整后的软件,联合运行了本次评估。最终仅由AVERI解密输出,并按照AILuminate基准标准评分,得到对模型属性的定性和(小规模)定量评估。
目前,企业会做出合同承诺,不监控与模型的特定交互,包括第三方评估机构开展的评估。但更强、有技术支撑的保障可以更大程度确认承诺得到遵守,在国际核查这类场景中会格外有价值。
本次成果出现在AI政策发展的关键时刻。SB 315这类法律,以及欧盟《通用人工智能实践准则》这类标准,都正确要求第三方评估过程中尊重安全与隐私,但几乎没有给出实现这一目标的指导。
正在考虑审计要求的政策制定者,可以从本次结果中获得信心,大胆要求提供深度、安全的访问权限。安全飞地只是目前快速发展的众多能支持这类访问的技术之一。
此外,立法者发出需求信号会进一步加速这类技术成熟,同时也会推动配套“低技术”方案的发展,比如向企业派驻审计人员。今天也标志着一个更公开的阶段的开始——
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖