AI Pulse

连Anthropic也降价了,AI推理价格战蔓延

连Anthropic也降价了,AI推理价格战蔓延

我已经写了很多关于推理经济学的文章——尤其是随着“够用就好”的开放权重模型的出现。我们开始看到所有前沿实验室都展开了真正的价格竞争,连一向不愿降价的Anthropic也不例外。让我们深入探讨一下市场动态。

OpenAI打响了发令枪

7月底,GPT-5.6 Luna最初那次80%的降价无疑震动了市场,事实上,这是近年来头一次有一个非开放权重模型短暂登顶OpenRouter。

紧接着GPT-6 Luna和GPT-6 Sol又降价50%。大约两个月内,Luna降价90%,Sol降价60%。

对于一家前沿实验室来说,这是一条异常激进的降价轨迹。显然OpenAI想要夺取市场份额,而且我认为这已经被证明非常成功。

DeepSeek

虽然这篇文章如果详细讨论所有开放权重模型会变得太长,但我认为DeepSeek是最值得关注的。他们的推理效率确实给市场留下了深刻印象——毫无疑问前沿实验室在幕后也在做类似的事情——但他们在公开渠道发表的大量论文真正引起了我的注意。

让我们快速看一下他们在官方API上的推理价格(▲/▼ 与同一时段之前价格的对比):

生效日期(2026)模型时段输入缓存输入输出
Apr 24V4-Flash全天$0.14$0.028$0.28
Apr 26V4-Flash全天$0.14$0.0028 ▼$0.28
Aug 16V4-Flash非高峰$0.22 ▲$0.007 ▲$0.66 ▲
Aug 16V4-Flash高峰$0.44 ▲$0.014 ▲$1.32 ▲
Sep 10V4.1-Flash非高峰$0.15 ▼$0.003 ▼$0.60 ▼
Sep 10V4.1-Flash高峰$0.30 ▼$0.006 ▼$1.20 ▼

有意思的是,这些价格相比4月的基准其实上涨了——非高峰时段的输入价格大致持平,但非高峰输出价格约为2倍,高峰时段约为4倍。不过需要注意的是,DeepSeek的“高峰”时段实际上是中国的高峰时段,所以对西方时区来说,这些时段大部分恰好很好地覆盖了工作日。

为了强调OpenAI的降价力度有多大,他们现在在输入和输出token上比DeepSeek还便宜。但这其中有一个重要的陷阱——DeepSeek在缓存输入方面仍然便宜得多,而正如我最近所写的,缓存输入实际上构成了智能体用例的大部分成本,所以我认为对许多用例来说DeepSeek会(往往显著)更便宜,但这是一个我觉得没有多少人真正注意到的非常有趣的市场动态。

Anthropic的回应

不过我认为最大的新闻还得是Opus 5.5的大幅降价。我一直有种感觉,此前Anthropic并不真正认为他们需要在价格上竞争。

我认为Fable反响平平可能改变了他们的想法。一方面激进的护栏让它难以用于许多高要求的工程工作,另一方面定价又极高,我觉得很多人都坚持用Opus。

不过有了Opus 5.5,他们似乎确实在回应市场,输入和输出token的价格都降低了20%。虽然这仍然比Sol贵得多,但更值得关注的是缓存读取价格的降幅——下降了60%(!)。由于缓存读取是较长智能体会话的主要成本驱动因素,这实际上比20%的表面数字要大得多,某些会话的综合费率可能因此降低50%。

看起来未来几周还会有一款新的Haiku 5.5模型发布——它将成为Luna的直接竞争对手。我非常好奇他们是否会就此与OpenAI展开价格竞争。

并排对比

以下是当前价格的对比情况(每百万token),以及两个示例智能体会话的成本。会话A是1000万次缓存读取、50万输入和20万输出。会话B更偏缓存密集:2000万次缓存读取、20万输入和10万输出。为简单起见,我忽略了缓存写入。

模型输入缓存读取输出会话A会话B
GPT-6 Luna$0.10$0.01$0.50$0.25$0.27
DeepSeek V4.1-Flash(非高峰)$0.15$0.003$0.60$0.23$0.15
DeepSeek V4.1-Flash(高峰)$0.30$0.006$1.20$0.45$0.30
GPT-6 Sol$2.00$0.20$10.00$5.00$5.40
Opus 5$5.00$0.50$25.00$12.50$13.50
Opus 5.5$4.00$0.20$20.00$8.00$6.80

会话越偏缓存密集,DeepSeek相对Luna的优势就越大——Opus 5.5也越接近那50%的降幅。

前沿市场到底有多大?

但这引出了一个非常有趣的问题。Luna、DeepSeek等模型在日常使用中完全够用,而且用起来更快。随着这些模型越来越好,对大型、昂贵的前沿级模型的需求会越来越少。

所以我相信这些模型和降价正在蚕食大量收入。这无疑会被远为更多的消费量所抵消,但毛利率会低(得多)。

公平地说,降价并不等于利润率下降。如果服务成本以同样的速度下降,利润率完全可以撑住——正如我之前写过的,我认为这些实验室在推理方面有很大的余地。但两个月内降价90%,很难仅用效率提升来解释。

我越来越清楚地看到,我们最终可能会陷入这样一种局面:Astra、Fable和Opus级别的模型变成面向特定任务的非常专业化的细分市场。普通的“办公室”工作者使用较小模型已经绰绰有余,而且越来越多的软件工程任务也是如此。

我不太相信旗舰模型的推理市场在中期会有那么大。

这给前沿实验室带来了一个非常有趣的问题。这些模型的训练成本几乎肯定要高几个数量级,而它们的相对需求可能正在下降,这意味着训练成本分摊到了更少的客户身上。严格来说,训练是研发而非销售成本,所以不会体现在毛利率中——但这确实意味着每次训练要回本需要长得多的时间,如果真能回本的话。

假设这种情况持续下去,会带来两个显而易见的结果。

第一个结果是前沿实验室不再训练这些巨型模型,转而更专注于推理效率和较小模型的质量。这有多可行,我不太确定,中国实验室非常适合这种模式,而且大部分情况下成本基础要低得多。很难不注意到,在这种情况下,呼吁监管来为前沿发展定速的声浪对实验室来说相当有利。如果谁都不被允许跑在前面,你就可以更久地榨取每一次昂贵训练的价值。

另一个结果是前沿实验室向技术栈的上层移动,不再为这些较大模型提供推理服务,而是把这些模型留给自己,致力于“垂直整合”的产品,例如制药领域的尖端科学研究。我们看到Anthropic悄悄建立了一个生物学实验室,这与这一方向吻合。

但一如既往,这个市场的动态很难预测。无论哪种方式,我们都在见证平价智能的爆发,而在一两年前这看起来还不太可能。

我建议密切关注这些价格更新。我现在的直觉是,市场将越来越转向奖励那些能在推理效率上取得突破的公司,而不是奖励那些拥有原始智能的公司。

阅读原文
📚 相关主题 行业分析商业

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新