AI Pulse

谷歌让AI不背完整对话,100步任务token用量降94%

核心思路: 智能体在推理过程中,通常会将完整的对话历史作为输入的一部分。SKILL.state 提出用当前状态的结构化表示加上最新观察结果来替代这一做法。

当智能体在解决问题时,它会将认为对未来步骤有用的信息写入状态中,然后丢弃对话历史。这样一来,随着会话的进行,输入大小基本保持恒定。

他们使用 Gemini-3-Flash 运行了一个 100 步的基准测试:

* SKILL.state:准确率 0.94,消耗 65k tokens
* LangGraph 风格的有状态基线:准确率 0.91,消耗 1.1m tokens

注意事项: 这种方法在智能体能够理解未来步骤需要什么信息时效果最佳,否则那些信息不会被写入状态,智能体将不得不重新检索。

论文链接:[https://arxiv.org/abs/2608.262630

―― 高票评论(帖子共 14 条讨论)――

[+10] u/Overall-Importance54:所以是否有某个组件将对话历史转换为状态模型?他们有没有命名什么具体方法,别让我去读论文啊哈哈 状态压缩协议

[+4] u/Im_Talking:这太重要了。而且减少 token 消耗其实只是一个额外的好处。真正的好处在于,可以通过确保每一步的提示词都是最小化、最优化且与智能体的实际“目标”对齐,从而以确定性的方式对智能体进行治理。

[+1] u/Risc12:我在自己的 harness 里也尝试过类似的东西。

缺点是当前的历史模型适应性很强,而特定的数据结构需要 LLM 去适应,我很难让一个指令模型正确地配合它工作,所以我猜他们是对模型进行了专门的调优或训练。

[+1] u/Glittering-Flan-2637:上面提到的治理才是关键

历史意味着智能体总能重新讨论之前的决定,而状态意味着它必须对所写的内容做出承诺,而你能读到的内容就是它在行动前可以检查的内容。

[+1] u/keeperLogical76:智能体保留一张持续更新的便利贴,记下重要事项,而不是保留整个对话记录。65k 对 1.1m tokens 的对比说明对话记录大部分都是“背景噪音”。

[+1] u/code_the_cosmos:这难道不会消除缓存读取吗?缓存的输入 token 比未缓存的输入 token 便宜得多。

[+0] u/tavorasc:要小心可能的提示注入。

[+-1] u/manishiitg:减少 94% 的 token 很不错,但可怕的是失败模式——状态看起来完整无误,却悄悄丢掉了一个约束。我希望看到对不良状态写入后的恢复能力的衡量,而不仅仅是平均任务得分。

[+-4] u/boringfantasy:软件工程师这下彻底没戏了。

阅读原文
📚 相关主题 大语言模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新