国内大模型集体返工预训练,万亿参数输1%小模型
国内大模型最近开始集体返工预训练了。
这个事情最有节目效果的地方在于,前两年大家天天聊 Scaling Law,参数往万亿堆,GPU 一车一车买,token 烧得像不要钱。最后模型效果不对,查了半天,发现是吃的是鹅腿阿姨的葱汁鹅腿。
雷峰网提到一个匿名案例。有家公司花了接近一年,训了一个万亿参数模型,最后被参数量只有它大概 1% 的小模型反超。最后排查下来,问题主要在数据。
网页垃圾、重复语料、低质量标注,全都往训练集里炫。
万亿参数模型:收到,这就认真学习。
腾讯混元已经算是公开返过一次工。今年 2 月开始,重新搭预训练和强化学习基础设施,重新定数据标准、清洗原来的语料。之前老混元也被曝过打榜数据混进训练集、标注规则混乱之类的问题。
阿里和百度当然没有承认这个问题,但新模型的动作都很诚实。Qwen3 开始用 Qwen2.5 系列模型清洗文档,再补大量数学和代码合成数据。文心 4.5 也开始搞去重、低质量过滤、数据地图和人工复核。
过去行业默认,只要模型够大、数据够多、算力够用,能力总能被硬堆出来。现在大家慢慢发现,Scaling Law 可以帮你放大能力,也可以帮你高效率地学习互联网垃圾。
所以接下来我反而挺想看,哪家公司开始敢公开讲自己的数据工程。毕竟参数量还能往 PPT 上写,数据里到底掺了多少屎,只有模型自己知道。