Opus 5.5读得多干得久,运营成本反而低约40%
Anthropic 发布了新模型 Opus 5.5。按 token 计费的典型工作负载下,运营成本比 Opus 5 低约 40%。
2026年3月到9月,Claude Code 里每个提示词驱动的工作时长涨到3.3倍。模型调用次数多了40%以上,中断次数减少了68%。每个请求的上下文量增加到2.6倍。输入输出 token 比例从189:1变成324:1。模型读得越来越多,写的反而相对更少。
读得多、干得久,照常理账单该更贵。钱反而省下了。关键在缓存。
Anthropic 把缓存读取价格降了60%,输入和输出 token 价格各降20%。缓存读取占 AI 代理和编码类工作的成本大头。这一块便宜下来,整体成本才可能跟着降。Opus 5.5 读一个缓存 token 的价格只有竞品模型的五分之一,性能还更强。Claude Code 里缓存未命中的输入减少了超过50%。
缓存为什么不容易断
缓存的价值在命中率。Claude Code 做了不少事来保住它。刷新登录这类小干扰,可能弄断缓存。中途添加指令、按需加载工具这类大动作,也可能弄断。这些环节现在都堵上了。
Opus 5.5 和 Fable 5.1 还能在会话中直接改努力级别,不用重置缓存。API 密钥和云服务商用户现在能设置一小时的缓存生命周期,订阅者此前已有这个选项。分叉的子代理从父代理的缓存接着读,不为相同的上下文再付一遍钱。
实际能省多少
Zeta Labs 在两个模型上做了对比。Opus 5.5 每个任务的轮次和工具调用比 Opus 5 更少。成本几乎减半,完成的最难任务数量翻倍。输出生成速度也快了30%以上。
省钱幅度依任务类型而不同。范围明确的任务里,两个模型完成所用轮次大致相同,唯一的差别就是价格。开放式任务里差距最大,模型可能花很多轮在错误方向上。缓存的价值,在这种地方才真正体现出来。
怎么用更划算
Anthropic 的建议:会话开始时就选好模型,不要中途切换。离开前先压缩对话,别等回来再压缩。API 密钥或云服务商用户,给长会话设置一小时的缓存生命周期。
同样的半年里,开发者的使用方式也在变化。接入工具服务器或使用技能的可能性,大约是原来的两倍。把文本粘进提示词的可能性,减少了三分之一。