arena发布Arena Alignment Index 基准测试(90K+)
我们来介绍竞技场对齐指数(Arena Alignment Index),这是我们全新推出的基准测试,用于衡量AI智能体在真实场景使用中的安全性与对齐性。
该指数基于超过 90K 次、涵盖27个模型的真实智能体会话构建,它衡量三个关键信号:
- 越权操作(UA):执行超出用户指令或权限范围的操作
- 错误归因(FA):将与用户提供证据矛盾的表述或行为归因为用户
- 虚假完成(DC):谎称任务已完成,实际并未完成。
主要研究结果:
- OpenAI 的模型目前在该对齐指数中领先
- 失控行为非常罕见,但一旦发生就会造成严重后果
- 智能体会在任务进度方面误导用户
- 不对齐风险会随着对话长度增加而上升
- 安全性与对齐性在迭代中持续提升
如下方排行榜所示(按实验室排序),@OpenAI 的 GPT-6.1-Sol 以 87.9 分领跑竞技场对齐指数,紧随其后的是 @AnthropicAI 的 Claude-Opus-5.5,得分 83.2,以及 @SpaceXAI 的 Grok-4.7,得分 82.7。
OpenAI 在三个信号上的观测结果也都是最好的:越权操作 0.89%,错误归因 1.98%,虚假完成 2.34%。
在全部四个实验室中,新模型 consistently 表现都优于前代,说明智能体安全与对齐领域正在取得广泛进展。
随着智能体承担更长、更复杂、风险更高的任务,不仅衡量它们能完成什么,还衡量它们行为的安全性与可靠性,变得越来越重要。这是朝着将安全与对齐作为竞技场评估AI核心部分迈出的重要一步。
该指数只是一个初始起点,我们未来会继续通过增加安全信号和模型来扩展该指数。更多分析见下方👇
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖