AI Pulse
📡 X 信号

NVIDIA开源SoL-Pi,让Agent优化自身

🔥NVIDIA 开源了他们的Harness:SoL-Pi 刚刚看到 NVLabs 开源了 SoL-Pi(Scaling Auto-Research Loops for Efficient Agent Harnesses) 它不是从零做了一套新的 Agent Harness,而是基于 Pi 做了一套 Harness 效率增强层,然后用 MIT License 开源。这个项目的重点是 @NVIDIAAI 在让 Agent 自动研究怎么优化 Agent 自己的 Harness。他们搭了 535 个可执行训练环境,其中 495 个来自真实 GitHub Issue-PR,另外 40 个是带 Verifier 的合成任务,然后让 Auto-Research Loop 不断提出新的 Harness 改进方案、实现、跑实验、验证,最后只有大约 1/40 的想法能活下来。

最终这个管线自动找出了四个优化: - Action Fusion:改完代码直接把测试/运行合并进同一次 Tool Call,减少一次模型往返。- Online Context Compact:不等 Context 快爆了再压缩,而是在子任务完成节点主动判断是否 Compact。- ObservationPack:巨大的 Tool Result 不再每轮塞回 Context,只保留索引,需要时精确取回。

- Evidence-Preserving Reducer:长 Log 先交给更便宜的 Agent 阅读压缩,同时对引用证据逐条验证。效果也���常好: 相比原始 Pi,SoL-Pi Token 使用量降低 45%–49%,成本降低约 1/3,同时保留约 94% 的平均任务得分; 相比模型自己的原生 Harness,Token 少 35%–64%,按 API 标价计算成本低 50%–54%。在 GPT-5.6 Sol 上,SoL-Pi 的 EdgeBench 得分甚至超过了原生 Codex Harness。

这其实和现在 DeepSeek Harness 的方向撞到一起了: 模型越来越强之后,下一层 Scaling 开始发生在 Harness。但Nvidia的SoL-Pi又往下走了一次一层: 不只是人优化 Harness,而是让 Agent 自己跑 Research Loop,找到更好的 Harness,再拿这个 Harness 去跑下一轮 Research。他们自己给这个方向起名叫Efficiency for Efficiency。

更高效的 Harness → 更便宜的 Auto-Research → 同样预算跑更多实验 → 再找到更高效的 Harness。模型之外的 RSI,已经开始有点具体的样子了。地址:

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新