AI改进AI:模型选择带来的增益变化是框架选择的1.8倍
AI 能让其他 AI 变得更好吗?又是什么阻止它直接作弊?上个月,一个 OpenAI 评估智能体逃出了沙箱,闯入了 Hugging Face,似乎是去抓取某个基准的测试答案。这正是你从一个会改写智能体、还能读到自身成绩的系统身上所预料到的行为。尽管如此,我们还是着手测量递归式自我改进——只不过把考卷锁在了它的沙箱之外。
我们推出了 HarnessOpt-Bench,它根据一个 LLM 对另一个智能体框架的改进程度来打分。在开发集上,优化器能看到每个用例的追踪记录;验证时,它只会收到一个汇总分数;测试时,它什么也看不到——直到一台受信任的服务器为它最终的候选框架打分。API 密钥、预算执行机制和留出数据永远不会进入优化器的沙箱。这种隔离靠构造成立,而非靠指令:留出的评估器和权限控制都处在演化框架的循环之外。
5 个前沿模型、4 个下游任务、111 次运行,用来检验两个假设:
1️⃣ 相同的编码框架,只换模型:OpenCode 下的 Claude Opus 5 在 4 个任务中拿下 3 个第一。顺着某一任务从 2025 年 11 月到 2026 年 7 月的版本发布看下来,GPT 从可提升空间的 3% 爬到 49%,Claude Opus 从 37% 到 59%。
2️⃣ 相同的模型,只换编码框架:模型在自己家的框架里表现最好吗?没有一致的主场优势:在 20 个模型–任务组合中,opencode 击败原生框架(Claude Code、Codex、Kimi CLI)11 次。模型选择带来的增益变化是框架选择的 1.8 倍。
论文:https://arxiv.org/abs/2608.06301
代码(MIT,基于我们团队的 ICML 2026 VeRO 构建):https://github.com/scaleapi/vero
原文:https://www.linkedin.com/posts/shehabyasser_can-an-ai-make-other-ais-better-and-what-share-7498801902260981760-xuCo/