AI Pulse
📡 X 信号

研究者披露大模型自主科研实验最新结果

研究者披露大模型自主科研实验最新结果

据我所知,这是目前在研究环境中对自主智能体迭代进行的最大规模公开实验。我们扩展了运行时长、算力、模型多样性和工具集合。

作为对比,oai/anthropic系统卡片中的类似任务,包括anthropic的「在CPU上优化LLM训练」,以及openai gpt 5.6完成的nanogpt赛道1任务,运行时长都不到一天。我们还公开了大量细节(轨迹、暂存记录等),因此你可以深入研究不同模型处理这类任务的方式。

这个实验的噪声相当大,相同设置下的单次运行在24小时后会有约50步的偏差。我觉得非常惊人的一点是,尽管不同模型探索的思路大致相近,任务和环境本身也存在大量方差,不同模型之间的表现差距仍然很大。

fable 5缩小了82%与当前人类纪录的差距,kimi K3的表现也非常出色。我目前正在运行grok 4.6、deepseek v4 pro、muse spark 1.2、qwen 3.8 max和glm 5.3,预计下周会公布结果。

我最喜欢的部分之一,是模型在本次实验过程中自行开发出的一些工具,尤其是配合prime agent使用时。举例来说,kimi K3就创建了自己的实验API,用来生成优化器变体、比较损失、牛顿-舒尔茨调参等等。

我们还拿到了deepseek v4 pro配合prime agent运行的早期结果:它在启动GPU运行之前,先跳出常规的nanogpt循环做了PSGD实验来建立直觉。博客里还有其他工具集下的其他精彩案例!

我对我们在这个方向上的构想也感到非常兴奋,我们会继续研究,去理解(闭源和开源的)前沿模型的研究能力。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新