张一鸣反对AI知识蒸馏,业内看法分歧很大
张一鸣在字节seed的全员会上谈到了自己是反对蒸馏的,他认为这虽然能在短期内改善模型表现,但本质上,是在复制别人 已有能力的路径。如果沿着这条路走,最多只能接近,无法实现超越。他更希望seed可以从更底层的维度去构建自己在AGI上的壁垒。
过去的几年里,中国AI因为算力约束,被迫走了这种效率优化路线,而蒸馏正是这种路线的重要组成部分。其实我倒是觉得,蒸馏从正面的角度来看,是一种工业化技术。怎么说呢,就大部分人理解蒸馏是这样的,大模型A很强-抄答案-小模型B变强,但真正的蒸馏是大模型产生了在大量高质量行为样本之后,小模型去学习它的推理路径、解决问题的方法、表达方式,包括工具调用方式,从而形成一种新的能力结��。
我更倾向于认为,这类似于学生和老师学习,也不是复制老师的大脑,只是学习老师解决问题的方法。很关键的一点是,蒸馏改变了 AI 竞争的格局。过去一直都是谁的 GPU 多谁赢。
如果是这样,差距很快会被不可逆转地拉大,因为谁能保证凭借 GPU 的优势训练出更强的 AI 之后,AI 不会又造出更牛逼的 GPU,形成一种循环垄断呢?这是本质上有一点类似接近资源能力垄断,但有了蒸馏之后,未来或许是谁更能压缩智能,谁更能占得先机。毕竟大模型在耗费巨资进行训练之后,真正到了推理场景、每天有几亿次调用、真正商业化的时候,成本是极其重要的。
蒸馏就是把大模型能力压缩成便宜模型能力,这很有商业价值。不过赵一鸣有一点说得很对,大模型蒸馏确实不是未来AGI路线,就像我两个月前在 MSX 的一场 Space 里分享的那样,语言模型主要还是学习人类已有的知识。但人类已有的知识并不优质,而且终有用尽的那一天,相比于整个世界的知识确实太少了。
因此,我认为真正的智能需要世界模型,需要物理理解,需要自主学习,蒸馏永远无法创造新的智能。至少我对智能的期待并不是学生模仿老师,而是机器自己观察世界。我的想法是,模型的能力来自规模,但未来突破还是来自新的训练方法。
只是说,知识蒸馏确实是深度学习不可避免的一环。这里说个行业小趣事吧,因为我在做GPT代充和中转站的业务,所以了解到大部分“正常用户”几乎都是不会卖OpenRouter的正规正价codex额度的,因为太贵了,那么那么贵的额度是谁在买呢?基本上都是搞蒸馏的。
AI的竞争已经到了第二-第三阶段了。第一阶段是比谁训练最大模型,当时的赢家当之无愧是OpenAI、Anthropic,也包括谷歌吧。第二阶段是谁能最低成本复制智能,这里 DeepSeek、千问甚至 Meta Llama 都胜出了,因为这比的是开源+蒸馏+低成本部署。
第三阶段可能会比谁能创造新的智能,赢家或许会重新回到OpenAI、anthropic和DeepMind(注意不是谷歌)手上。如果从投资的角度来看,蒸馏会削弱纯模型能力的护城河,但它会增强算力、效率和应用部署的价值。单纯卖最强模型的企业受到的影响是偏负面的。
GPU、HBM 或许仍能受益。像做推理成本优化、开源模型生态、Agent应用和数据闭环的公司价值依旧是提升的。所以,有些公司我认为是可以闭眼买的。
所以我准备以后写美股文都小赌怡情一下,小开一万U写的公司,但不构成投资建议,只是为写作增添乐趣,我重仓的标的会在私域群发布。另外打个广告,GPT代充和中转站服务都可以联系我喵!