同一个大模型换AI Agent harness 评分从59.1涨到83.9
同一个模型,只换 Agent harness,分数能从 59.1 涨到 83.9。 模型一点没变。 harness 可以简单理解成 AI 外面的那套工作系统,负责怎么记忆上下文、怎么规划、怎么调用工具、什么时候停。 我知道 harness 很重要,但真没想到差距能大到这个程度。 而且更夸张的是 token 消耗。 数据放评论。
同一组 xBench 实验: Claude Code:559K tokens Codex:680K OpenCode:1.157M JIT-Agent:212K 最后 JIT-Agent 分数还是最高的,82。 这数据真的很有意思。 有些 Agent 看起来一直在疯狂干活,调用一堆工具、跑一堆步骤、烧一堆 token,最后结果还真不一定更好。
JIT-Agent 的思路其实很好懂。 它会先看你要做什么,再现场决定这次任务该怎么记忆、怎么规划、怎么调用工具、怎么执行。 搜索任务可以一套。 旅行规划可以另一套。 以后甚至还能把以前效果好的 harness 存下来,下次继续用。
所以我现在更在意 Coding Agent 的 harness 了。 Claude Code、Codex、Cursor、OpenCode,就算塞进去同一个模型,最后表现都可能差非常多。 很多时候你觉得某个 Agent 更聪明,差距可能就藏在模型外面这一层。 论文:
这篇论文真正提出的东西叫 JIT-Agent。 它的核心思路很有意思: 先看任务,再现场生成一套最适合这个任务的 Agent harness。 也就是连怎么记忆、怎么规划、怎么调用工具、怎么组织执行,都可以根据任务动态变化。 效果好的 harness 还可以被保存下来,以后遇到类似任务继续复用。 等于开始让 AI 连自己的工作方式也一起优化了。