代码智能体安全拒绝率 Sonnet 5.5 仅4.5%
现在,在人工分析编码代理指数(Artificial Analysis Coding Agent Index)中,安全拒绝报告会显示何时发生了拒绝,以及回退使用了哪些模型。
我们新增了两种查看结果的方式:
➤ 拒绝时机:查看拒绝是仅在任务提示阶段就发生,还是在代理已经开始工作后的任务后期发生
➤ 回退模型:查看代理在拒绝后切换到了哪个模型,同时也展示被阻止的尝试
目前,Claude Code with Sonnet 5.5 (max) 在该指数中排名第一。它的安全拒绝率为4.5%,大约是Claude Code with Opus 5.5 (max) 8.9%拒绝率的一半。
Sonnet 5.5大约94%的拒绝都发生在第一轮对话之后。在发生拒绝后,代理几乎总是切换到Opus 4.8。
观察到的回退模式因模型和代理配置而异。在Fable 5.1中,Claude Code主要回退到Opus 4.8,而在该指数的Devin Fusion回退中,Opus 5占比要大得多。
这两种视图在整个指数和每个基准测试中都可用。安全和回退行为由提供商配置,可能会随时间变化;这些比率反映的是基准测试时记录的行为。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖