AI Pulse
📡 X 信号

代码智能体安全拒绝率 Sonnet 5.5 仅4.5%

代码智能体安全拒绝率 Sonnet 5.5 仅4.5%

现在,在人工分析编码代理指数(Artificial Analysis Coding Agent Index)中,安全拒绝报告会显示何时发生了拒绝,以及回退使用了哪些模型。

我们新增了两种查看结果的方式:
➤ 拒绝时机:查看拒绝是仅在任务提示阶段就发生,还是在代理已经开始工作后的任务后期发生
➤ 回退模型:查看代理在拒绝后切换到了哪个模型,同时也展示被阻止的尝试

目前,Claude Code with Sonnet 5.5 (max) 在该指数中排名第一。它的安全拒绝率为4.5%,大约是Claude Code with Opus 5.5 (max) 8.9%拒绝率的一半。

Sonnet 5.5大约94%的拒绝都发生在第一轮对话之后。在发生拒绝后,代理几乎总是切换到Opus 4.8。

观察到的回退模式因模型和代理配置而异。在Fable 5.1中,Claude Code主要回退到Opus 4.8,而在该指数的Devin Fusion回退中,Opus 5占比要大得多。

这两种视图在整个指数和每个基准测试中都可用。安全和回退行为由提供商配置,可能会随时间变化;这些比率反映的是基准测试时记录的行为。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新