Marin 535B大模型训练全程公开可围观
🔥太疯狂了,现在你甚至可以直播围观一个 535B 大模型是怎么被训练出来的。
斯坦福教授兼 @simile_ai 创始人 @percyliang 刚刚宣布,他们的新模型 Marin 535B-A23B 本周正式开训,而且整个训练过程公开。
Marin 共有 535B 总参数,其中 23B 激活参数。
为此Percy他们一共准备了18.75T tokens的数据,动用了 11 套 GB200 NVL72,约 792 张 GB200显卡。
预计连续训练 3 个月,总训练计算量约 2.7e24 FLOPs。
训完还会继续做 post-training。
请注意,Marin 真的全部开源了整个训练过程。
正式开跑前,他们先训练了一套 4 级 Scaling Ladder,从 1.6B-A61M 一路跑到 27.7B-A1.2B,用小模型提前预测这次 535B 主模型的 loss 和训练状态。
现在主模型正式开跑,所有人都可以直接围观实时训练曲线,后面的数据、实验记录、工程问题也会持续公开。
类似的事情以前有人做过。
2022 年 BigScience 训练 176B 的 BLOOM 时,就公开过训练进度和 TensorBoard。
但 Marin 这次直接把公开训练的规模推到了 535B。
目前来看,这应该是人类公开围观过的最大规模大模型训练之一。
接下来三个月应该会很好看。
模型最后能不能打是一回事,我更想看的是一个 500B+ 模型的MoE到底会怎么训、怎么调,以及中间到底会炸几次。
这种机会太少见了,等于把一场原本只有顶级 AI Lab 内部才能看到、成本可能高达数千万美元的训练实验,直接摊在全世界面前。