AI Pulse

Anthropic卖"完整模型访问",39%调用零思考令牌

过去一段时间,Claude用户在论坛上反复抱怨同一件事:模型好像变笨了。有人觉得是自己提示词写得不好,有人以为只是错觉。一项为期65天的分析给出了另一个解释。

43,000次调用里的证据

这项分析覆盖43,000多次Claude Code调用。其中39%的Fable 5调用拿到零个思考令牌,中位数调用只有123个。Anthropic在基准测试里给模型配的是16K到128K思考令牌。差距不止一个数量级。

思考令牌加到128K时,模型得分还在往上走。推理能力还在,只是没有交付到用户手里。

时间线上也有规律。8月的思考预算比7月下降了18%到50%。8月22日前后约一周,中位数思考令牌直接跌到零。

用户为什么很难察觉

模型是非确定性的,同一个提示每次回答都不同。遇到质量波动,用户第一反应是检讨提示词,而不是怀疑服务商调低了推理预算。

Anthropic对外销售“完整模型访问”。背后的推理机制,在用户看不见的地方被调低了。有用户在Claude应用里注意到,以前会触发的思考过程现在不触发了;有人遇到Opus在新对话里连续犯错误、忘记指令;还有人发现,让模型生成报告时,它不再读取已给出的格式规范,而是凭印象猜测格式。猜测性回答的比例在上升。

订阅和API的差异

订阅和API两边的报告很不一样。一个用Max 5订阅的团队反复遇到模型不遵循指令、触发护栏、评估分数下滑。团队里有人跟用API的朋友公司聊过,对方表示完全没遇到这些问题。

两份反馈放在一起,指向一种可能:订阅渠道和API渠道拿到的推理配额并不等价。

对个人用户,代价是回答不稳定,多花时间反复纠正。团队把AI接进生产流程的话,代价更直接。代理工作流依赖行为一致性,同样的任务今天能完成、明天不能,生产任务就会失败。

用户开始行动

一些用户已经用钱包投票。有人取消了订阅,理由是额度消耗过快加上模型变笨;有人转向OpenRouter,开始测试其他模型。

有用户说,这种降级应该被禁止。也有人认为,“模型变笨”从论坛阴谋论变成了有审计数据支持的事实。

还有用户猜测,Anthropic可能在为新模型预留算力——Opus 5的更新早该来了。这个猜测目前没有证据。

到底是短期限流还是长期策略,其他AI公司有没有类似做法,都还不清楚。

对订阅用户来说,眼下能做的只是留意模型在关键任务上的稳定性,续费时把这段经历算进去。

阅读原文
📚 相关主题 大模型商业

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新