AI Pulse

规模定律不止参数:数据、算力与后训练的多维扩展

> 关于规模定律的思考

扩展,但不仅仅是参数的扩展。每一次模型发布都以同一个问题收尾:多少参数?这个问题无法单独回答。参数数量只有在另外三个变量相伴时才有意义——你有多少数据、打算把算力花在哪里,以及谁将在什么条件下运行这个模型。

这个领域是吃了苦头才学会的。Kaplan等人(2020)拟合出一个指数,告诉所有人参数增长应快于数据——大约2.7:1——行业照做了:GPT-3、Gopher、MT-NLG。Hoffmann等人(2022)在四百个模型上重做了实验,发现计算最优的分配更接近每个参数20个token,并且在算力充足时两者应以相同速率增长,而不是逐渐背离。早期拟合的误差随算力每提升一个数量级而复合放大,这正是那一代最大模型资源错配最严重的原因。回想起来,万亿参数那一轮是整个领域一起走过、又一起折返的弯路。

Chinchilla也不是终点。它优化的是针对“训练一次、评估一次”的模型的训练算力。如今一个模型每天被调用数十亿次,推理主导了全生命周期成本。把推理纳入目标函数后,最优解转向更小但训练时间长得多的模型——有意的过度训练——Llama-2-7B和Gemma-2-9B就是这么做的,分别达到大约每参数290和889个token。

稀疏性再次移动了目标。在MoE模型中,两个量必须分开来看:总参数大致决定模型能装下多少——知识、事实、长尾——而激活参数和有效深度大致决定它能思考多远,能在崩溃前承载多少步因果链。稠密模型20:1的比例并不能直接迁移。而且这个比例根本不是单一数字:Roberts等人(2025)发现最优的每参数token数取决于任务,记忆类任务偏好更多参数,推理类任务偏好更多数据。后续关于MoE的研究观察到,在固定TPP下,把总参数推得更高实际上会损害推理,而激活更多专家则稳定地有助于推理。

这对我们正在构建的目标很重要。发现漏洞不是一个检索问题。它不是来自记住更多CVE;而是来自把二十步的推理链条完整走到最后而不丢失线索。这种能力并不存在于总参数数量之中。

这就引出了本次发布。总参数似乎只在达到某个阈值之前起作用——足以装下整个世界——之后额外的能力来自其他维度的扩展:每次前向传播的有效深度,尤其是后训练。GLM-5.3是我们对这一论断所做的受控实验。与GLM-5.2相同的基础模型、相同的架构、相同的总参数和激活参数。一个月的长周期环境扩展和强化学习。收益绝非边际性的。扩展不只有一个旋钮。这次我们转动了后训练这个旋钮,因为它还有最多的余量——不是因为其他旋钮已经到头了。基础模型规模、预训练数据、每次前向传播的算力:这些都还在桌面上,我们会逐一回来处理。这个实验教给我们的是:旋钮不必一起转动,而下一个值得转动的旋钮,很少是上一次值得转动的那个。我们还没有停止扩展。下一次,也许是中训练、预训练,甚至更多。

阅读原文
📚 相关主题 大语言模型缩放法则

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新