以前AI可能提前看到测试题,现在Google把它锁进加密盒子
AI模型的能力和安全,靠基准测试打分。这套体系有个已知漏洞:模型提前看到测试题,分数就会被人为抬高。政策制定者、研究人员、企业都靠这些分数判断真实能力和安全性,分数一旦不可信,评估就失去意义。
8月27日,Google拿出了新方案:世界首个针对专有前沿AI模型的双盲评估。外部评估被关进加密“盒子”,模型在测试前接触不到题目,也就没法提前针对测试优化表现。
过去,外部测试题目的保密靠零日志协议和严格的合同条款。现在,Google在合同约束之外又加了技术和加密层面的保障。
第一个接受这种评估的是Gemini Flash Lite。合作方包括新加坡AI安全研究所、OpenMined、AVERI和MLCommons,测试在隐私保护环境中使用保密基准进行。
Google说,它评估AI系统用了一套很宽的体系,不只靠内部测试,还找专业研究实验室、公民社会和各国AI安全研究所从外部找盲区。Google认为,技术和加密保障是安全模型评估的一次重要进步。
加密盒子防的正是基准污染。试点刚启动,实际效果要看跑起来之后。
📚 相关主题
谷歌