AI Pulse
📡 X 信号

唐杰重新解读Scaling Law:大模型不只要堆参数

刚刚,智谱创始人唐杰老师,在X上发了一篇超棒的帖子,专门说了下他对Scaling Law的理解。

正好今天AA的成绩也出来了,我把原帖和AA指数都放在评论区了。

GLM-5.3拿到了60分,上一代GLM-5.2是53分,基座是完全相同的,总参数753B,激活40B,而且大家Coding体感也都很棒,都觉得是国产SOTA了。

但也有很多人也在说为啥智谱这次不训个新的基座模型。唐老师这篇帖子,刚好讲的非常清楚,也有非常多的干货。

他说,Scaling,从来不只有参数量这一个点。我们以前一聊大模型,最先问的总是参数量,但是参数量单独拿出来,其实说明不了多少东西。

现在它至少还得跟另外三个问题放在一起看:
模型有多少数据。
算力花在了哪。
谁在什么条件下运行它。

这背后,其实是Scaling Law过去几年一直在发生的变化。

2020年,Kaplan等人算出一个比例,认为参数增长应该比数据增长快得多,大概是2.7比1。然后整个行业也都这么走了,很多模型越做越大,万亿参数也一度被当成了模型进步的必经之路。

到了2022年,Hoffmann等人拿四百多个模型重新做了一遍实验,结果发现,算力最优的分配更接近每个参数20个Token。算力继续增加时,参数和数据应该以差不多的速度一起增长。

这就是Chinchilla Scaling Law。其实现在回头看,之前那一轮最大的模型,反而也是算力分配最失衡的一批。参数堆得太快,数据没有跟上,实际上效果没有那么好。

但版本还在变化, 因为Chinchilla考虑的是一个模型训练一次,然后拿去评测。但是今天的模型上线以后,每天可能被调用几十亿次,上线后的推理成本可能远远大于那一次训练。

所以如果我们把这笔账也算进去,最优解又会往更小、训练更久的模型移动。到了MoE时代,那个简单的20比1也不够用了。

唐老师在帖子里区分了两个很重要的东西。
总参数量,大概决定模型能装下多少知识、事实和长尾信息。
激活参数和每次前向计算的有效深度,大概决定模型的长程推理能力。

需要记忆的任务,更吃参数量。需要推理的任务,更吃数据。后续研究甚至发现,在每个参数对应Token数量固定时,继续增加总参数可能会让推理变差,激活更多专家反而会稳定地提升推理能力。

所以,大模型到底有多聪明,早就没法被一个总参数量概括了。

GLM-5.3这次,唐老师说,它更像一次控制变量实验。大模型Scaling依然在继续。

只是它已经从一个越来越大的数字。变成了寻找最优解的游戏。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新