AI Pulse
📡 X 信号

Prime Intellect 披露 AI 自主科研实验,已追平人类 82% 分数

Prime Intellect 披露 AI 自主科研实验,已追平人类 82% 分数

卧槽,AI在科研方面已经追上能代替82%的人类了?!Prime Intellect刚刚完成了一次迄今为止规模最大的公开实验,研究前沿模型如何进行 AI 研究。

最佳模型已经可以追平人类 82%的分数。他们直接给AI一台8×H200的机器,让模型自己连续做几天研究。没有联网,没有人类介入。

任务是把一个124M nanoGPT的训练效率尽可能往上推。AI需要自己完成整个研究循环: 提出假设、修改optimizer、写代码、跑实验、分析loss curve、发现bug、做ablation、重新设计实验,然后继续下一轮。他们一共跑了153次实验,测试18个前沿模型。

当然,这个实验不是无脑堆算力。@PrimeIntellect 会根据24小时后的表现动态决定是否继续,而Fable 5的最佳trajectory最终持续运行了8.7天。结果是Fable 5把达到目标loss所需的训练步数从3290降到了2726。

人类目前最好的record是2600。也就是说,它已经填平了baseline和人类纪录之间81.7%的差距。Opus 5是2920,Kimi K3是2930,GPT-5.6 Sol是3042。

但我觉得排行榜反而是这篇研究里最不重要的部分。真正有意思的是: Prime Intellect发现,强模型和弱模型之间最大的区别,并不是谁能想到更多新idea。事实上,大部分模型最后探索到的optimizer方向都差不多,而且很多早就在已有文献里出现过。

真正拉开差距的是:谁更会做实验。弱模型跑一次失败,就可能直接放弃整个方向。甚至一个实验没有马上出现显著提升,就换下一个方向。

而强模型已经开始表现出一些很像人类researcher的行为: 会跑多个seed验证结果; 会重新ablate之前已经加入的改动; recipe发生变化之后,会重新测试之前失败过的idea; 甚至会尝试把两个单独无效的改动组合起来,看是否存在interaction effect。更夸张的是,AI还开始自己给自己造研究工具。比如Kimi K3在Prime Agent环境里,自己写了一套optimizer variant生成工具、实验launch工具、loss curve分析工具。

后面甚至自己搭了一个numerical laboratory,先模拟Newton-Schulz,再把得到的参数拿回真实训练中验证。这件事让我想到一个最近越来越明显的趋势: 过去我们理解AI Agent,大概是: Model → Tool → Task 但现在开始变成: Model → 自己构建Tool / Workflow / Harness → Task → Result → 再修改Harness 这已经开始有一点Research Harness自我改进的味道了。当然,现在还远远不能说是recursive self-improvement。

模型没有修改自己的weights,也没有真正产生大量原创研究idea。Prime Intellect自己最后也承认: 目前这些AI最大的特点是,research execution已经非常强,但research novelty依然明显不足。但这反而是我觉得最值得关注的地方。

现在看,第��步可能根本不是模型突然学会修改自己的weights。而是模型开始能够连续几天甚至几周自主研究,并且在过程中不断给自己搭建更好的实验工具、验证机制和研究Harness。这也callback了我之前关于DSH的看法。

一旦这个Harness这个循环闭环,且越来越长,越来越稳定之后。那Model × Harness × Compute可能会比单纯提升模型参数本身更加重要。而且这也再次说明,今天用一个10分钟benchmark去评价模型,越来越像在评价一个研究员“做十分钟科研有多强”。

给它10分钟、24小时、8天。你测到的,可能已经不是同一种能力了。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新