JIT-Agent让小模型性能反超GPT-5.6
同一个模型,临时换一套更合适的 Harness,性能真的可以跨过更强的前沿模型。
这篇论文提出 JIT-Agent,专门学习「怎么给 Agent 设计 Harness」。
过去 Harness Agent 这套东西大多由人提前设计好,再复用到不同任务。
JIT-Agent 换了一个思路:先看当前任务,再现场生成一套专门的 Harness。
它把 Harness 拆成四部分:Memory、Planning、Action 和工具/Skill 编排。生成后如果运行失败,还会根据报错自动修复;随着任务积累,表现更好的 Harness 会进入经验库,继续影响后面的生成。
效果很明显。
DeepSeek-V4-Flash 加上 JIT-Agent 后,在 DeepSearchQA 上从 76.2 提升到 85.1,超过 GPT-5.6 的 76.0;GLM-5.2 在部分任务上最高提升 20.2 个百分点。
还有在固定底座模型的对比中,JIT-Agent 在 6 组实验里都用了最少的 token 和 API 成本,平均比最便宜的固定 Harness 还省 36%。
对于 Agent 的 Scaling 方向,除了升级模型、增加推理算力,我们也可以训练一个系统,专门学习「面对这个任务,应该怎么组织 Agent」。
📎 arxiv: