北京大学拆掉AI代理脚手架,成功率反而涨了
💥我靠!拆掉脚手架,成绩反而更高,北京大学把 Agent Harness 蒸进权重,成功率飙升至23.3% → 44.3%,甚至超过基础模型挂着优化 Harness 时的 41.7%!
核心亮点:训练时用优化 Harness 当老师,部署时只留最小 Harness,能力写回权重。论文称为 Harness Distillation。
关键上手步骤:
1️⃣克隆仓库,uv sync;要训练再加 --group tinker。Python 3.12–3.13,轨迹在 Docker 沙箱里跑,密钥写入 .env。
2️⃣先演化学生侧 Harness(工具、中间件、技能、记忆),再改写成老师私有参考 K,仓库里 harness_bank/ 已有 Spreadsheet、AppWorld、USPTO 三套。
3️⃣harness-zero run-rollout:Student 在最小 Harness 下行动,Harnessing Agent 用 K 审查,要么 PASS,要么在学生能执行的动作空间里 REPLACE。
4️⃣harness-zero build-sft 只留成功轨迹,再 train-sft 对 Qwen3.5-9B 做 LoRA SFT。审查过程不进学生可见轨迹。
5️⃣部署只留最小 Harness,卸掉专用 Harness、参考 K 和老师模型。不想自己训,可直接下 metaevo-ai/ahd-9b-ssb、ahd-9b-appworld、ahd-9b-uspto。
别再给每个任务外挂一套越来越重的 Harness,先让它当老师,再把老师卸掉。
论文:
开源:
#HarnessZero #Agent #北大 #港科大 #开源 #LLM #AIAgent