连Anthropic也降价了,AI推理价格战蔓延
我已经写了很多关于推理经济学的文章——尤其是随着“够用就好”的开放权重模型的出现。我们开始看到所有前沿实验室都展开了真正的价格竞争,连一向不愿降价的Anthropic也不例外。让我们深入探讨一下市场动态。
OpenAI打响了发令枪
7月底,GPT-5.6 Luna最初那次80%的降价无疑震动了市场,事实上,这是近年来头一次有一个非开放权重模型短暂登顶OpenRouter。
紧接着GPT-6 Luna和GPT-6 Sol又降价50%。大约两个月内,Luna降价90%,Sol降价60%。
对于一家前沿实验室来说,这是一条异常激进的降价轨迹。显然OpenAI想要夺取市场份额,而且我认为这已经被证明非常成功。
DeepSeek
虽然这篇文章如果详细讨论所有开放权重模型会变得太长,但我认为DeepSeek是最值得关注的。他们的推理效率确实给市场留下了深刻印象——毫无疑问前沿实验室在幕后也在做类似的事情——但他们在公开渠道发表的大量论文真正引起了我的注意。
让我们快速看一下他们在官方API上的推理价格(▲/▼ 与同一时段之前价格的对比):
| 生效日期(2026) | 模型 | 时段 | 输入 | 缓存输入 | 输出 |
|---|---|---|---|---|---|
| Apr 24 | V4-Flash | 全天 | $0.14 | $0.028 | $0.28 |
| Apr 26 | V4-Flash | 全天 | $0.14 | $0.0028 ▼ | $0.28 |
| Aug 16 | V4-Flash | 非高峰 | $0.22 ▲ | $0.007 ▲ | $0.66 ▲ |
| Aug 16 | V4-Flash | 高峰 | $0.44 ▲ | $0.014 ▲ | $1.32 ▲ |
| Sep 10 | V4.1-Flash | 非高峰 | $0.15 ▼ | $0.003 ▼ | $0.60 ▼ |
| Sep 10 | V4.1-Flash | 高峰 | $0.30 ▼ | $0.006 ▼ | $1.20 ▼ |
有意思的是,这些价格相比4月的基准其实上涨了——非高峰时段的输入价格大致持平,但非高峰输出价格约为2倍,高峰时段约为4倍。不过需要注意的是,DeepSeek的“高峰”时段实际上是中国的高峰时段,所以对西方时区来说,这些时段大部分恰好很好地覆盖了工作日。
为了强调OpenAI的降价力度有多大,他们现在在输入和输出token上比DeepSeek还便宜。但这其中有一个重要的陷阱——DeepSeek在缓存输入方面仍然便宜得多,而正如我最近所写的,缓存输入实际上构成了智能体用例的大部分成本,所以我认为对许多用例来说DeepSeek会(往往显著)更便宜,但这是一个我觉得没有多少人真正注意到的非常有趣的市场动态。
Anthropic的回应
不过我认为最大的新闻还得是Opus 5.5的大幅降价。我一直有种感觉,此前Anthropic并不真正认为他们需要在价格上竞争。
我认为Fable反响平平可能改变了他们的想法。一方面激进的护栏让它难以用于许多高要求的工程工作,另一方面定价又极高,我觉得很多人都坚持用Opus。
不过有了Opus 5.5,他们似乎确实在回应市场,输入和输出token的价格都降低了20%。虽然这仍然比Sol贵得多,但更值得关注的是缓存读取价格的降幅——下降了60%(!)。由于缓存读取是较长智能体会话的主要成本驱动因素,这实际上比20%的表面数字要大得多,某些会话的综合费率可能因此降低50%。
看起来未来几周还会有一款新的Haiku 5.5模型发布——它将成为Luna的直接竞争对手。我非常好奇他们是否会就此与OpenAI展开价格竞争。
并排对比
以下是当前价格的对比情况(每百万token),以及两个示例智能体会话的成本。会话A是1000万次缓存读取、50万输入和20万输出。会话B更偏缓存密集:2000万次缓存读取、20万输入和10万输出。为简单起见,我忽略了缓存写入。
| 模型 | 输入 | 缓存读取 | 输出 | 会话A | 会话B |
|---|---|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.01 | $0.50 | $0.25 | $0.27 |
| DeepSeek V4.1-Flash(非高峰) | $0.15 | $0.003 | $0.60 | $0.23 | $0.15 |
| DeepSeek V4.1-Flash(高峰) | $0.30 | $0.006 | $1.20 | $0.45 | $0.30 |
| GPT-6 Sol | $2.00 | $0.20 | $10.00 | $5.00 | $5.40 |
| Opus 5 | $5.00 | $0.50 | $25.00 | $12.50 | $13.50 |
| Opus 5.5 | $4.00 | $0.20 | $20.00 | $8.00 | $6.80 |
会话越偏缓存密集,DeepSeek相对Luna的优势就越大——Opus 5.5也越接近那50%的降幅。
前沿市场到底有多大?
但这引出了一个非常有趣的问题。Luna、DeepSeek等模型在日常使用中完全够用,而且用起来更快。随着这些模型越来越好,对大型、昂贵的前沿级模型的需求会越来越少。
所以我相信这些模型和降价正在蚕食大量收入。这无疑会被远为更多的消费量所抵消,但毛利率会低(得多)。
公平地说,降价并不等于利润率下降。如果服务成本以同样的速度下降,利润率完全可以撑住——正如我之前写过的,我认为这些实验室在推理方面有很大的余地。但两个月内降价90%,很难仅用效率提升来解释。
我越来越清楚地看到,我们最终可能会陷入这样一种局面:Astra、Fable和Opus级别的模型变成面向特定任务的非常专业化的细分市场。普通的“办公室”工作者使用较小模型已经绰绰有余,而且越来越多的软件工程任务也是如此。
我不太相信旗舰模型的推理市场在中期会有那么大。
这给前沿实验室带来了一个非常有趣的问题。这些模型的训练成本几乎肯定要高几个数量级,而它们的相对需求可能正在下降,这意味着训练成本分摊到了更少的客户身上。严格来说,训练是研发而非销售成本,所以不会体现在毛利率中——但这确实意味着每次训练要回本需要长得多的时间,如果真能回本的话。
假设这种情况持续下去,会带来两个显而易见的结果。
第一个结果是前沿实验室不再训练这些巨型模型,转而更专注于推理效率和较小模型的质量。这有多可行,我不太确定,中国实验室非常适合这种模式,而且大部分情况下成本基础要低得多。很难不注意到,在这种情况下,呼吁监管来为前沿发展定速的声浪对实验室来说相当有利。如果谁都不被允许跑在前面,你就可以更久地榨取每一次昂贵训练的价值。
另一个结果是前沿实验室向技术栈的上层移动,不再为这些较大模型提供推理服务,而是把这些模型留给自己,致力于“垂直整合”的产品,例如制药领域的尖端科学研究。我们看到Anthropic悄悄建立了一个生物学实验室,这与这一方向吻合。
但一如既往,这个市场的动态很难预测。无论哪种方式,我们都在见证平价智能的爆发,而在一两年前这看起来还不太可能。
我建议密切关注这些价格更新。我现在的直觉是,市场将越来越转向奖励那些能在推理效率上取得突破的公司,而不是奖励那些拥有原始智能的公司。