AI Pulse

输入token砍掉65%,编程助手省成本不降效

输入token砍掉65%,编程助手省成本不降效

AI编程助手Deep Agents发布了v0.7版本,核心变化是基础输入token减少了65%,从约6k降至约2k。按API计费的开发者,每次调用都能省下不少钱。

性能下降了吗?评估结果给出了否定答案。v0.7在自主、对话、长上下文三个类别上,测试了四个模型——gpt-5.6-luna、gemini-3.6-flash、claude-sonnet-4-6、claude-opus-4-8。奖励分数整体稳定,置信区间跨越零,统计上没变差。其中gpt-5.6-luna的token还额外降了34%,成本降15%,奖励反而升了4%。

不过有一个例外:claude-sonnet-4-6的成本显著增加。分析LangSmith追踪记录后发现,主要来自两个有挑战性的自主任务。不是所有模型都同样受益。

如何做到的

v0.7的优化思路之一,是把TodoListMiddleware改为默认关闭、可选择性启用。之前的版本中,AI代理每步都会维护一个待办事项列表,这在复杂多步骤任务中有用,但简单场景里就是浪费token。评估显示,关闭待办后奖励反而略有上升、成本更低。不过它在长多步骤任务、能力较弱的模型和UI场景中仍有价值。

另一个灵感来自Anthropic。他们刚发布了更新的上下文工程指南,报告称给Opus 5和Fable 5模型削减了Claude Code系统提示的80%以上,编码评估没有下降。Anthropic的两条发现与v0.7的改进方向吻合:接口优于示例,避免重复指令。v0.7正是朝这个方向调整了提示结构,不再塞入重复的示例和说明。

对开发者的实际影响

用户现在可以完全控制底层的提示和中间件堆栈:覆盖内置的FilesystemMiddleware、SummarizationMiddleware,甚至可以替换全局基础提示。你可以自定义触发阈值——SummarizationMiddleware默认在上下文窗口达85%时启动,现在可以设置自己的提示和阈值。

文件系统也有多项优化。写文件时不再因文件已存在而报错,直接覆盖。读文件时返回总行数、剩余行数和下一个偏移量,方便分页。grep和glob搜索大目录时不再卡死,而是返回部分结果并带截断标志。

不兼容改动:v0.5时弃用的后端工厂支持被彻底移除,必须使用具体的BackendProtocol实例。默认文件系统工具列表中新增了delete工具,但可以选择退出。

评估与使用

评估套件包含三个类别(自主、对话、长上下文),在四个模型上测试。开发者升级到v0.7后,日常任务通常能直接感受到token消耗下降。对于使用较弱的模型或长上下文场景,可以考虑手动启用TodoListMiddleware来保持规划能力。

这是Deep Agents在提示工程上的一次务实更新——省成本、保效果,同时给用户更多控制权。

阅读原文
📚 相关主题 开源

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部