AI Pulse
📡 X 信号

开发者分享nanoGPT优化项目的核心发现与体验

DevenPzak表示,自己很享受参与这个项目的过程,认为新的基于浮点运算感知(flop-aware)的nanoGPT优化思路是有用的,对类似的计算优化场景很有帮助。这个优化思路的结论简单且符合逻辑:明确实际需求,再按需利用资源。整个项目过程充满乐趣。

关于本次项目记录,DevenPzak提到,部分可用于前沿预训练缩放的技术已经从记录中删去。最重要的是,优化器系列ANVIL的大幅改进版本ANVIL III没有被包含在本次记录中,因为它是hyperstition_cc的专属技术。

和Muon优化器相比,ANVIL III拥有相同的运行速度,但在参数量从1.24亿到12亿(124M-1.2B)的所有模型尺寸、最高到8倍Chinchilla的训练深度下,损失能降低20-28毫纳特(millinats),同时超参数一致性非常好,信噪比也极高。使用ANVIL III可以减少训练步数,让竞速项目结果再提升0.7秒,同时整体损失更低,单这一点就能证明该项目记录还有很大的改进空间。

很多人问自动研究(autoresearch)在这项工作中发挥了多大作用,答案是几乎没有作用。尽管几乎所有代码实现都由Claude Code完成,但构思几乎全部由DevenPzak自己完成,他曾和METR_Evals详细讨论过这个问题。

工作期间项目团队拥有一批H100显卡,在夜间或是DevenPzak停止工作时,会派出多个智能体尝试对竞速项目进行爬山优化、改进记录。总体来看,尽管智能体累计投入的时间比DevenPzak更多,但取得的进展少得惊人。

无论给出怎样的指引,智能体都很难跳出局部最优解,要么困在对某种方法的无效调优上——这种方法只能节省0.1秒,却会增加约5毫纳特的损失,显然是糟糕的 trade-off,要么就是连续数小时调整超参数,只换来极小的改动。这种现象和METR报告中描述的情况一致。

不过DevenPzak认为,问题并不出在智能体缺乏相关知识,而是当前大语言模型存在的“性格问题”:它们大多不相信能实现这种大跨步的改进,或是采用了错误的范式。

DevenPzak结合自身经验表示,自动研究对这项工作帮助不大,在没有特殊框架的情况下,当前这一代公开可用的模型很难完成高质量的自动研究。但他同时指出,相关能力和知识其实已经存在,这意味着我们距离真正的自动研究可能比近期结果显示的更近。

最后,DevenPzak对维护项目仓库的@Classiclarryd和@KellerJordan表示了感谢,本次提到的@kellerjordan0是标注错误。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新