高端大模型降价一半,性能只降了0.5%
卧槽????tmd这次 @claudeai 把牙膏挤爆了🤯!!!
Anthropic刚刚发布Claude Opus 5。 以拉爆Claude Fable 5的前沿能力,价格直接来到Fable的一半。
Opus 5的API价格是每百万Token输入5美元、输出25美元,和Opus 4.8完全相同。 Fable 5则是10美元和50美元。
Anthropic直接把它定义为一款可以每天使用的高端模型,并将其设为Claude Max默认模型、Claude Pro最强模型。
跑分方面在CursorBench 3.2中,Opus 5开启最高Effort后,成绩只比Fable 5峰值低0.5%,但单任务成本只有后者一半。
在Frontier-Bench上,它以更低的单任务成本,将Opus 4.8的成绩提升到两倍以上。 Anthropic称,Opus 5目前已经在Frontier-Bench和GDPval-AA等编程、知识工作评测中达到SOTA。
Agent和电脑操作的提升更夸张,同时ARC-AGI 3成绩是第二名的3倍。。。
Zapier AutomationBench中,同等成本下通过率约为第二名的1.5倍,即使使用最低Effort,完成的任务也比其他模型更多。
OSWorld 2.0中,Opus 5只花Fable 5略高于三分之一的成本,就超过了Fable 5的最好成绩。
但这次最值得关注的,可能还不是跑分。
Anthropic反复强调Opus 5更擅长验证自己的工作,并持续迭代到任务真正完成。
一个测试里,模型拿不到机械零件原图,只能访问原始像素。Opus 5自己写了一套计算机视觉管线,提取几何结构,最后在FreeCAD中重建出了完整零件。
另一个任务中,它发现没有实时数据流可以验证代码,于是顺手给自己搭了一套测试框架。
这是一种很关键的Agent能力:发现当前环境缺少完成任务所需的工具,然后自己创造工具。
Opus 5同时加入了Fast Mode,速度大约是默认模式的2.5倍,价格是基础版本的两倍。
API模型名为claude-opus-5,目前已经登陆Claude、Claude Code、Claude Cowork和Claude Platform。
Anthropic现在的模型分层也越来越清楚: Sonnet负责规模和成本; Opus负责绝大部分高难度日常工作; Fable和Mythos继续探索能力与高风险领域的最前沿。
Opus 5真正的场景是大量编程、研究、数据分析和Agent任务,它正在让用户很难继续为Fable 5支付两倍价格。
前沿模型开始主动下放能力、压低价格。
模型战争接下来的重点,会从谁的能力上限最高,逐渐变成谁能用更低成本,把任务稳定地做完。
牛逼,看来前段时间 @OpenAI 和中国开源模型们( @Kimi_Moonshot 和 @Zai_org )真的给A/太多压力了!
继续加油啊家人们!