AI Pulse
📡 X 信号

解读LLM预训练的相对泛化不变性新研究

解读LLM预训练的相对泛化不变性新研究

刚刚读完一篇非常吸引人的论文:《大语言模型预训练的相对泛化不变性》。

它揭示了一个非常反直觉的结论:用不同优化器和不同架构训练出来的模型,虽然学到的参数和表征完全不同,但却保留了几乎完全一致的token级别相对损失结构。而如果改变训练数据,这种不变性就会被打破。

这从根本上改变了我对优化、架构和数据在大语言模型预训练中各自作用的看法。

1/12 | 什么是相对泛化不变性(RGI)?我们用L_A(d)表示模型A对验证样本d(上文+目标token)的交叉熵损失。RGI指出:

[ L_A(d₁)-L_A(d₂)=L_B(d₁)-L_B(d₂) ]

等价于:

[ L_A(d)=L_B(d)+C_AB ]

换句话说,两个模型可以一个整体表现更好、一个更差,但token之间的相对难度结构保持不变。这比单纯说两个模型取得相似损失要强得多。

2/12 | 实验结果非常惊人。

作者在FineWeb上用六种优化器训练了GPT模型,分别是Adam、Adam-mini、Lion、Muon、Soap和Scion。在共享初始化和数据流、1.24亿参数的设置下:在大约2000步训练后,RGI的 Concordance Correlation Coefficient(CCC,一致性相关系数)就超过了0.95,相对差异降到了0.05以下。

在1万步时,Adam对比Muon的验证损失对齐R²达到了0.99。拟合出来的关系几乎完全符合:

[ L_Muon ≈ L_Adam - 0.07 ]

Muon并不是选择性地提升了部分token的表现,相反,整个token级损失分布整体向下平移了一个常数。这非常了不起。

3/12 | 这种现象不止出现在优化器之间。

RGI并不局限于不同的优化算法,这种现象在架构改变时也大致存在,包括:
注意力机制:RoPE / NoPE / ALiBi,全注意力 / 滑动窗口注意力
FFN激活函数:GELU / SiLU / 平方ReLU
不同随机初始化
模型宽度的适度变化

这说明一个深刻的道理:不同的优化轨迹和架构选择,并不一定会产生不同的相对泛化结构。

4/12 | 但改变数据得到的结果完全不同。

作者控制了其他设置不变,对比了分别在FineWeb、C4、ArXiv和CodeParrot上训练的模型。结果差异极大。

即使用相同的Adam优化器,在FineWeb上训练的模型和在ArXiv或CodeParrot上训练的模型,也不会表现出相同的RGI。C4表现出部分对齐,这可能是因为它的分布更接近FineWeb,但关系仍然不稳定。

这指向了一个重要的区别:优化器通常只会改变损失的整体水平,而数据才会重塑相对损失结构本身。

5/12 | 为什么这不能简单地用神经切线核(NTK)或惰性训练来解释?一个很自然的假设是,模型始终保持在初始化附近,因此不同优化器实际上学到的是相似函数。但实验结果并不支持这个假设。模型已经发生了大幅……

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新