jietang 重新讨论大模型缩放,参数不是唯一指标
关于缩放定律缩放的思考,但缩放不只是针对参数。现在每次发布模型最后都会被问同一个问题:有多少参数?这个问题没法单独回答。
参数数量只有结合另外三个要素才有意义——你有多少数据,你打算把算力用在什么地方,以及什么人会在什么条件下运行这个模型。这个领域是吃过亏才明白这个道理的。
Kaplan 等人(2020)拟合出一个指数,告诉所有人参数增长速度要快于数据——大概是 2.7:1——整个行业都照做了:GPT-3、Gopher、MT-NLG 都是如此。
Hoffmann 等人(2022)在四百个模型上重新做了实验,发现计算最优分配更接近每个参数对应 20 个 token,而且在算力充足的情况下,两者应该同比例增长,而不是逐渐拉开差距。早期拟合的误差会随着算力每提升一个数量级不断放大,这就是为什么那一代最大的模型资源分配错得最离谱。
现在回头看,万亿参数那一轮是整个领域一起走的一段弯路,之后我们都改回来了。Chinchilla 也不是终点。它优化的是「训练一次就拿来评测」的模型的训练算力。
如今模型一天要被调用数十亿次,推理占据了全生命周期成本的大头。把推理纳入优化目标后,最优解就会偏向训练更久的更小模型——也就是刻意过训练,Llama-2-7B 和 Gemma-2-9B 就是这么做的,它们每个参数分别对应大约 290 和 889 个 token。
稀疏性又再次改变了目标。在 MoE 模型中,必须把两个量分开看:总参数大致决定了模型能容纳多少内容——知识、事实、长尾信息——而激活参数和有效深度大致决定了它能做多深的思考,能推完多少步因果链才出错。密集模型的 20:1 比例不适用。
而且这个比例根本就不是一个固定值:Roberts 等人(2025)发现最优的每个参数量对应 token 数是依任务而定的,记忆任务更偏向更多参数,推理任务更偏向更多数据。针对 MoE 的后续研究观察到,在固定 TPP 的情况下,推高总参数实际上会损害推理能力,而激活更多专家则能稳定提升推理表现。
这对我们现在正在开发的方向很重要。发现漏洞不是检索问题。它不是来自记住了更多 CVE;它来自把二十步推理链从头推到尾不丢失线索。这种能力不依赖总参数数量。
这就说到我们这次的发布了。总参数似乎在达到某个阈值前是有用的——足够容纳整个世界的知识就够——过了阈值之后,额外的能力来自其他方面的缩放:每次前向传播的有效深度,尤其是后训练。
GLM-5.3 是我们针对这个说法做的对照实验。和 GLM-5.2 有着相同的底座、相同的架构、相同的总参数和激活参数。我们花了一个月缩放长周期环境和 RL。收益可不是边际性的。嗯,缩放就是这样。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖