本地能跑27B模型,训练门槛居然这么高
可能很多人对27B模型没什么概念。 27B听起来好像也没多大啊,现在普通玩家128G内存都开始普及了。 但我讲几个冷知识。
Google训练Gemma 3 27B的时候,预训练数据是14万亿Token。 不是140亿,也不是1400亿。 是14万亿。 训练它的集群用了6144颗TPU v5p。 而27B这个数字,只代表它有大约270亿个参数。
光把BF16原始权重放进内存,大概就是54GB。 32K上下文跑起来,加上KV Cache,大概72.7GB。 注意,这还只是推理。 真正训练的时候还要塞梯度,优化器状态,激活值,各种通信Buffer。
所以你看到一个27B模型只有几十GB,很容易产生一种错觉。 这玩意我电脑都装得下,我是不是也能训练。 完全是两回事。
还有一个更离谱的地方。 14万亿Token是什么概念。 假如一个人一天非常夸张地读10万个Token,而且一天不休息。 读完这些训练数据,大概需要38万年。
而机器要做的也不只是把这些字读一遍。 它要一层一层做矩阵运算,算损失,反向传播,再一点一点修改270亿个参数。
所以我现在越来越觉得,本地能跑27B,甚至70B,是一件非常牛逼的事情。 不是因为我们的电脑已经可以训练它们了。 而是因为人类把一个需要几千颗AI芯片训练出来的东西,压缩,量化,优化之后,居然可以塞进一台桌子下面的小电脑里。 这个过程本身就挺赛博朋克的。