AI Pulse
📡 X 信号

英伟达MIT发布SoL-Pi,大模型API成本砍三分之一

英伟达MIT发布SoL-Pi,大模型API成本砍三分之一

Damn,三天前大家还在争论哪家大模型写代码更便宜, 今天老黄@JensenHuang 和@nvidia 英伟达直接掀桌子了: 问题根本不在模型, 在你的脚手架太蠢了。英伟达与 MIT 团队公开了全新架构 SoL-Pi, 放弃人工打补丁, 让算法自己演化出四套运行时机制。不仅在 GPT-5.6 Sol 和 Opus 5 上守住了评测水准, 更把 API 成本直接削去三分之一。

那些天天盯着大模型降价、却任由 Agent 脚手架疯狂烧钱的团队, 建议把这篇论文打印出来贴在工位上。英伟达实验室开源的SoL-Pi 论文,可以说是做了一件全行业早就该做的事: 用自动演化系统重新锻造 Agent 运行脚手架。在 51 个真实编程任务的严苛评测中, 面对 GPT-5.6 Sol 和 Claude Opus 5 这种巨无霸, 任务得分毫发无损, 但直接把 Token 消耗腰斩了 49%, 每跑一小时就能从 API 账单里直接省出 8.75 到 13.50 美元。

很多团队以前做智能体全靠工程师人肉写死调度逻辑, 试几个用例就自以为调好了, 跑进几十步的复杂长任务里, 臃肿的上下文几分钟就能把账单干爆、把模型智商撑死。英伟达这次最聪明的一步, 是彻底放弃了人类手工调优。他们把脚手架扔进多个不同的代码环境里, 让系统开启自动化研究循环, 像自然选择一样让无数机制自我对抗淘汰, 最终只有四个���理机制活了下来。

首先颠覆的是执行节奏。以前 Agent 走一步看一步, 调一次工具往返一次, 动作融合机制直接把连贯动作在端侧合并批处理, 砍掉了一大半网络和上下文震荡。然后是给运行中的上下文无损脱水。

它不是等上下文满了再调大模型写假大空的摘要, 而是在任务行进中对观察结果进行重组打包, 并在委托阅读长文件时强制保留证据行, 既把整个 API 成本砍掉整整三分之一, 又死死守住了关键代码细节不被遗忘。以前是工程师凭直觉给 Agent 编死板的笼子, 从今天起是算法在残酷淘汰中自己进化出最精密的骨骼。如果你的代码 Agent 每小时也能凭空省下十几美元, 你会选择把省下来的钱用来多跑十倍的并发测试, 还是换更大参数的模型?

我先说, 肯定无脑拉满并发, 把原本舍不得跑的全量回归测到爽。开源代码、论文地址和这套四机制的详细对照表, 我整理好放在一楼了。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新