Anthropic发布Claude Sonnet 5.5,性能接近Opus 5.5
Anthropic 推出了 Claude Sonnet 5.5:它在人工智能分析智力指数(Artificial Analysis Intelligence Index)上得分 56,仅落后于 Opus 5.5(最高档)2 分,但单次任务输出token数是我们见过最高的。
全力模式下,Sonnet 5.5 比 Sonnet 5 高出 18 分,在智力指数上排第 2,仅落后于 Opus 5.5(最高档)。
Anthropic 给 Sonnet 5.5 的定价和 Sonnet 5 完全相同,按每百万缓存输入/输入/输出 token 计算,价格分别为 $0.2/$2/$10,但它单次任务输出的 token 数量更高,每个任务成本为 $7.60,比 Sonnet 5 的单次任务成本高约 50%。
要点:
➤ 在智能终端使用和知识工作上达到领先模型水平:在 Terminal-Bench 4.0 中,Claude Sonnet 5.5 达到 64%,而 Opus 5.5 和 GPT-6 Astra 为 60%。
在 AA-Briefcase(Elo分1811 vs 1822)、GDPval-AA(Elo分1844 vs 1846)和 AutomationBench-AA(总得分71% vs 70%)上,Sonnet 5.5 与 Opus 5.5 持平,不过为了达到这个性能,它明显使用了更多 token。
➤ 我们测过的 token 用量最高的模型:在全力模式下,也就是它性能接近 Opus 5.5 的设置,Claude Sonnet 5.5 每个智力指数任务使用约 19.3 万输出 token。
这是我们测量过的最高 token 用量,比 Opus 5.5(最高档)或 Sonnet 5(最高档)高约 60%,约是 GPT-6 Astra(最高档)的 7 倍。
➤ 定价维持在每百万输入/输出 token $2/$10,和 GPT-6 Sol 一致。按这个定价,Claude Sonnect 5.5 不在智力对单次任务成本的帕累托最优边界上。
在高努力等级,它落后于 Opus 5.5,而在低努力等级,GPT-6 Astra 或 Sol 配置可以更低成本实现同等性能。在这个基础上,高努力设置的竞争力最强,仅略微落后于 GPT-6 Sol 的智力得分,而单次任务成本实际上相同。
➤ 在事实知识和科学推理上落后于 Opus 5.5:作为一个更小体量级的模型,在 AA-Omniscience 事实知识测试中,Sonnet 5.5 仍然落后于 Opus 5.5。
事实准确率得分为 54%,而 Opus 是 66%,不过幻觉率更低(47% 对比 59%)。在 Humanity's Last Exam 和 SciCode 上,它也比 Opus 低约 6 分。
这些评估是在 Claude Sonnet 5.5 的预发布部署上进行的,Anthropic 发现这个版本有一个缺陷,它会降低结构化输出请求的响应质量。公开版本已经修复了这个问题,Anthropic 预计性能变化极小或略被低估,但我们很快会重新运行相关评估。
其他模型细节:
➤ 上下文窗口:100 万 token,支持图像和文本输入,和 Sonnet 5 相比没有变化。
➤ 定价:和 Sonnet 5 最新定价保持一致,每百万输入/输出 token $2/$10;缓存写入 $2.5,缓存读取 $0.2。
➤ 努力等级:五个等级(低、中、高、很高、最大)。智力指数评估在所有五个等级上进行,开启了 Anthropic 默认的降级 fallback。我们观察到,Sonnet 5.5 在智力指数约 0.1% 的任务中触发降级,主要在 TerminalBench 4.0,所有情况下都会降级到 Sonnet 5。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖