小米直播大模型强化学习训练,一天烧掉500万
有人刷科技资讯时刷到一条爆料:小米正在直播大模型的强化学习训练过程,还把每天花了多少钱都列出来了。
强化学习(RL,一种让模型通过不断试错获得提升的训练方法),一直是大模型研发里最神秘的环节之一。外界只知道它烧钱,却很少能看到一线团队的实际训练细节。
小米MiMo团队沉默了近半年,这次直接把正在进行中的MiMo-V2.6强化训练过程全公开了。
@_LuoFuli 认为:过去半年团队只研究一个问题——强化学习到底能扩到多大规模。这次升级了三个方向:算力规模,单步处理约20亿token,1568条prompts每条同时跑16次推演,全异步运行;训练环境,一次运行混合多个任务的智能体强化学习;评估算力,用智能体组内分配,结合测试用例和评分标准给出奖励。后续会逐步开源所有细节。
@wquguru 统计了目前的烧钱速度:两个模型同时训练,一天烧掉约7.4万美元,折合人民币500多万元,平均每小时3000美元;Pro版本训练一步约6万美元,需要2到3小时;截至爆料时已经训练37小时,总共花了11万美元。这个花费还只是强化学习阶段,不包含之前的预训练。
@Kay2289123 认为:这次公开的训练方法和在线训练轨迹,比任何第三方解读都管用,想做强化学习方向的人直接可以拿它当学习路线。如果把大模型比作生日蛋糕,预训练是做蛋糕胚,监督微调是抹奶油,强化学习的探索就是上面那颗点睛的草莓。
过去大模型厂商的研发细节大多藏在论文里,读者只能看到结论,看不到过程里的试错和调整。
这次把整个训练过程连花费都公开,等于把研发厨房直接开放给所有人看。不管是想学技术的从业者,还是好奇大模型到底烧多少钱的普通人,都能直接看一手信息。
只是没人知道,这种公开会让更多人跟进,还是会让其他厂商更加保密?