UC伯克利研究称编码代理 harness 差价达5倍
这项研究的核心结论是:编码智能体的性能不会因为工具链(harness)的不同而变化,成本却会暴涨最多5倍。
- 加州大学伯克利分校等机构的研究团队验证了模型与工具链的适配性
- 研究对比了Claude Code、Codex CLI、极简开源项目Pi等3种工具链和7个模型
- 即使更换工具链,任务成功率的差异平均仅在±2%到5%之间
另一方面,同一模型的token成本最多会相差5倍。
研究将为了获得相同结果额外支付的成本命名为工具链税(Harness Tax)。
- 仅拥有read、write、edit、bash这4种工具的极简工具链Pi实现了最佳成本效益
- 相比之下,Claude Code在首次调用模型时的上下文大小达到了Pi的10倍以上
- 其中包含冗长的指令和工具定义,推高了每一轮的消耗成本
各厂商为自家模型优化的官方工具链未必是最优组合。
在Anthropic和OpenAI模型的12种搭配测试中,有9种搭配下第三方工具链的成功率更高。
例如Sonnet 4.6用Codex CLI运行比用Claude Code运行成功率更高。GPT-5.6 Sol用Pi运行比用Codex CLI运行成功率更高,成本还能降低约一半。
研究认为,日常任务里,轻量化、简单的运行基础比多功能工具拥有更高的可靠性和成本效率。除了对比模型基准测试,还应该把使用什么工具链运行纳入评估。