AI Pulse
📡 X 信号

高端大模型降价一半,性能只降了0.5%

卧槽????tmd这次 @claudeai 把牙膏挤爆了🤯!!!

Anthropic刚刚发布Claude Opus 5。 以拉爆Claude Fable 5的前沿能力,价格直接来到Fable的一半。

Opus 5的API价格是每百万Token输入5美元、输出25美元,和Opus 4.8完全相同。 Fable 5则是10美元和50美元。

Anthropic直接把它定义为一款可以每天使用的高端模型,并将其设为Claude Max默认模型、Claude Pro最强模型。

跑分方面在CursorBench 3.2中,Opus 5开启最高Effort后,成绩只比Fable 5峰值低0.5%,但单任务成本只有后者一半。

在Frontier-Bench上,它以更低的单任务成本,将Opus 4.8的成绩提升到两倍以上。 Anthropic称,Opus 5目前已经在Frontier-Bench和GDPval-AA等编程、知识工作评测中达到SOTA。

Agent和电脑操作的提升更夸张,同时ARC-AGI 3成绩是第二名的3倍。。。

Zapier AutomationBench中,同等成本下通过率约为第二名的1.5倍,即使使用最低Effort,完成的任务也比其他模型更多。

OSWorld 2.0中,Opus 5只花Fable 5略高于三分之一的成本,就超过了Fable 5的最好成绩。

但这次最值得关注的,可能还不是跑分。

Anthropic反复强调Opus 5更擅长验证自己的工作,并持续迭代到任务真正完成。

一个测试里,模型拿不到机械零件原图,只能访问原始像素。Opus 5自己写了一套计算机视觉管线,提取几何结构,最后在FreeCAD中重建出了完整零件。

另一个任务中,它发现没有实时数据流可以验证代码,于是顺手给自己搭了一套测试框架。

这是一种很关键的Agent能力:发现当前环境缺少完成任务所需的工具,然后自己创造工具。

Opus 5同时加入了Fast Mode,速度大约是默认模式的2.5倍,价格是基础版本的两倍。

API模型名为claude-opus-5,目前已经登陆Claude、Claude Code、Claude Cowork和Claude Platform。

Anthropic现在的模型分层也越来越清楚: Sonnet负责规模和成本; Opus负责绝大部分高难度日常工作; Fable和Mythos继续探索能力与高风险领域的最前沿。

Opus 5真正的场景是大量编程、研究、数据分析和Agent任务,它正在让用户很难继续为Fable 5支付两倍价格。

前沿模型开始主动下放能力、压低价格。

模型战争接下来的重点,会从谁的能力上限最高,逐渐变成谁能用更低成本,把任务稳定地做完。

牛逼,看来前段时间 @OpenAI 和中国开源模型们( @Kimi_Moonshot 和 @Zai_org )真的给A/太多压力了!

继续加油啊家人们!

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部