同样的活,怎么让AI少花一半token?
把任务结构改对:先压缩、再并行、清冗余,固定前缀让它吃缓存。截至2026年8月的做法。
同样一份工作,有人让 AI 跑二十轮、每轮重读一整份长历史;有人把任务拆开、并行处理、只把压缩过的结论递进去。前者 token 越烧越多,后者反而更省钱、更准。这篇文章给你三个可迁移的原理和一个缓存技巧,依据是 Anthropic 官方工程博客和文档的做法(截至 2026 年 8 月)。
先看清:token 是怎么被烧掉的
每轮对话,AI 都要把之前给它的全部内容重新读一遍:系统提示词(你对它的固定设定)、过去的每一轮问答、贴进去的文档和图片、工具返回的结果,甚至它自己上一轮生成的长输出。Anthropic 官方文档说得很直白:「请求里的一切都算进上下文窗口。」上下文窗口相当于 AI 的临时工作台,截至 2026 年 8 月,Claude 部分模型的上下文窗口最高可达 100 万 token(具体取决于模型)——但那是上限,不是让你装满。
所以消耗的大头往往不是你说的那一句,而是你带进对话的那一整套历史。会话越长,每一轮的实际花费越大。「同样的活,有人只花一半」的核心秘密不是省钱咒语,而是让 AI 每次开工前,眼前只有真正必要的东西。
原理一:先压缩,再干活
Anthropic 在分享自己的多智能体研究系统时给了一个关键判断:「搜索的本质是压缩——从海量信息里蒸馏出洞察。」他们的做法是:派多个子代理并行去查,每个子代理在自己的上下文窗口里工作,最后只把各自提炼出的最重要内容交给主代理。主代理从头到尾没看过原始材料。
普通人不用写代码,也能照搬这个结构:把「读材料」和「做事情」拆成两个会话。比如你要 AI 基于一份五十页的报告写一篇推文,先开一个窗口,让它把报告压成两页的要点摘要;再开一个新窗口,只带着摘要进去写。第二个窗口每轮的消耗,会比硬塞全文小一个量级。这一步你就是那个主代理——只让压缩过的结论进到干活现场。
原理二:能并行就并行,别在一个窗口里串行堆叠
同一个系统里,子代理之所以省,是因为它们各有独立的上下文窗口、互不污染,主代理最后只读各路结论。Anthropic 的内部评测也显示,这种「一个主导+多个并行子代理」的结构尤其擅长广度优先的任务——也就是要同时追好几个独立方向的活。
普通用户的操作就是:把大任务拆成互相独立的小任务,各开一个窗口同时做,最后再开一个窗口汇总。比如要对比三款手机,或者写三座城市的旅行攻略,别在一个窗口里串行问三次——那样每一轮都要重读前面所有回合。三窗并行,每个窗口都保持短小,最后的汇总窗口只需要读三份结论。省下的正是串行对话里反复重读的历史。
原理三:上下文会「腐坏」,该清就清
Anthropic 文档里有个专门的词叫 context rot(上下文腐坏):「上下文越长,准确率和召回率越差。」也就是说,把上下文塞满不只是费 token,还会让 AI 变笨。文档明确说:打理好上下文里有什么,和上下文有多大一样重要。
这给普通用户三条操作纪律。第一,话题一换就开新会话,别在旧对话里硬拐弯——网页聊天界面大多是「先进先出」地滚动丢旧内容,但它丢哪些不由你控制,不如你手动清场。第二,别反复粘贴同一份背景材料,需要时给一次就够。第三,贴文档之前先问自己:这里面的哪三句话是这次真正需要的?只贴那三句。省 token 和提质量,在这里是同一件事。
进阶:把固定不变的部分放最前面
如果你用的工具能看到 token 用量明细,或者底层接的是 API(比如 Claude 的官方接口和第三方客户端),还有个官方技巧:提示词缓存(prompt caching,把一段固定前缀存下来,之后重复计费时按更低的价算)。Anthropic 文档说,给请求加一个 cache_control 标记,系统就会自动把最长的那段可缓存内容缓存起来;多轮对话里反复用同一套固定的系统提示词、长模板或背景说明时,命中缓存的部分明显更便宜、响应也更快。截至 2026 年 8 月,缓存有效期有 5 分钟和 1 小时两档。
普通用户能借鉴的用法是:把你每次都要用的固定指令——角色设定、风格要求、模板结构——放在提示词最前面,并且保持不变;把每次变化的具体任务放在后面。固定前缀越稳定,缓存命中率越高。如果你是 API 用户,可以在请求中加入 cache_control 标记来开启自动缓存;普通聊天界面没有这个入口,那就保持「前面固定、后面变化」的结构,至少不亏。
诚实地说:能省一半的场景长什么样
省一半不是对所有任务都成立。单轮对话、上下文本来就很短的任务,没什么可省的。真正能省下一半的,是那些「长对话+重复背景+可并行拆解」的活:长文档写作、多来源调研、批量出稿。这也正是多智能体结构的主场——Anthropic 在自家研究评测里发现,多智能体系统比单个模型的内部评测综合表现提升 90.2%,但它说明了同一件事:压缩和并行,同时利好质量和成本。
少花一半的「一半」,不是靠哪个模型更便宜,而是靠你别再让 AI 每次开工都重读一遍它早就读过的东西。