北京中关村学院团队3个月从零训练出7B大模型
有志进入大模型实验室工作的人,从零开始学习模型训练现在仍有机会。北京中关村学院的一个团队,只用了3个月就从零训练出了一个参数规模70亿的大模型ZGCM-1。
比模型本身更重要的是,团队几乎公开了整个训练过程的全部内容:训练代码、数据处理流程、训练数据与配方、模型权重、中间检查点(checkpoint),甚至训练日志都对外开放查看。
这套过去只有进入头部大模型实验室才能接触到的完整训练流程,现在变成了一份公开的实战教材。学习者可以看到数据筛选配比的过程、训练问题的排查方法、模型能力随训练进程变化的规律,也能了解到论文中一句笼统描述背后具体的工作量。
团队在训练中曾遇到一个典型问题:损失值(loss)仍在下降,但模型能力突然退步。最终排查发现,问题出在数据分片和混洗(shuffle)环节,模型实际接收的数据比例已经偏离原定配方。
团队还公开了不少只有亲自训练模型才能得到的经验:对监督微调(SFT)数据进行更严格筛选后,样本量减少44.9%,整体效果反而提升;长思维链数据占比过高,会损害模型的指令遵循能力;智能体(Agent)数据不能脱离通用能力单独训练。
这个通常需要大团队协作完成的工程,最终由7个人完成,原因是团队搭建了数百个智能体(Agent),分别负责处理数据、运行实验、监控日志、定位故障和执行评测。
这件事不仅是从零训练大模型的公开教程,也是使用智能体扩大AI研发能力的真实案例。过去学习大模型训练,最大的门槛不是看不懂论文,而是看不到真实的训练过程,也没有机会亲手经历整套工程遇到的问题。
现在所有相关的代码、数据、模型和训练记录都已经公开。对于想要进入大模型实验室的人来说,这可以作为最好的入门实战项目:先复现,再理解,之后再尝试改进。相关内容已上传至GitHub,链接可查询原文。