业内播客总结了大模型竞争的14个核心判断
没想到上条帖子被很多朋友看到,索性再整理一些和@FanqingMengAI 录制的播客中的更多 insights 吧: 1/ 模型竞争到最后,拼的到底是什么?人才肯花钱就能招(比如我们最近聊下来,发现混元密集招了很多人);数据肯花钱也能买。那么最后是不是仍然要拼卡,大厂是否会长期占据更大的优势?
以上因素固然重要,但最后可能要拼组织架构。大家在技术上拼的东西可能越来越接近,最终比的是谁能把人才、算力、数据和决策机制真正协同好。(这也呼应了《晚点》前不久那篇关于混元的文章:姚顺雨加入后,混元在组织上进行了一系列调整,至少从那篇报道来看,这轮组织调整可能是混元回到正确轨道的重要原因之一。
) 所以,即使大厂掌握着更多资源,也未必真的能吃掉 Kimi、智谱和 MiniMax。2/ 蒸馏并不是国内模型变强的决定性因素。我们之前交流过的很多 researchers 都认为,国内模型真正的进步,更多来自资源有限倒逼出来的底层架构和工程创新;蒸馏只是一个加速手段。
即使没有 Claude API,一方面,国内模型已经可以生成合成数据;另一方面,如果真的下决心建设数据基础设施,凭借国内的人力规模,也未必做不出来。因此,蒸馏可以缩短追赶时间,但并不是国模变强的唯一原因,更不是最底层的原因。3/国内真正的优势是 Pre-training。
这是卡的匮乏倒逼出来的。Pre-training 更拼少数研究员的聪明才智;Post-training 则更吃工程、数据积累和组织协作,需要大量人力和长期沉淀。海外公司开始得更早,因此在 Post-training 上其实更有优势。
4/ Post-training 背景的人,比 Pre-training 背景的人更容易创业。逻辑很简单:Pre-training 非常吃资源,初创公司很难 cover 相应的成本。而 Post-training 的创业方向相对明确:一是做数据,二是做平台类的事情。
后者有点抽象,可以简单理解成做 Benchmark 和 Eval。5/ 模型持续变强,甚至未来 Self-evolving RSI 取得进步,也不一定会直接吃掉第三方的机会,尤其是在垂直领域。拿 Harness 来举例,且不说这一层会不会越来越薄(@istdrc 就认为 agent harness 会越来越厚),即便会变薄,模型也未必能完���吃掉这部分空间。
一方面,未来并不是所有需求都必须调用最顶级的模型。(事实上,大多数普通用户已经很难感知新旧模型之间的能力差异。) 另一方面,垂直场景里仍然存在安全、隐私、工作流和行业知识等需求。
6/ Benchmark 和 Eval 在发生变化。以前主要考 AI 会不会做题,现在还要考 AI 会不会做事。比如,AI 能不能真正用好飞书、Notion,能不能进入一个真实的软件环境,把一项任务从头做到尾。
7/ 训练模型的门槛已经大幅降低,技术往往会向更简单、更直面结果的方向收敛。比如在 Pre-training 领域,从 Transformer 架构到 rule-based RL 这类训练方法,最后真正有效的方案往往都很简洁。Post-training 可能也会经历类似的过程:大家越来越不需要纠结具体的算法,最后还是要回到最本质的问题——有没有高质量的数据。
8/ 模型对数据的需求,大致经历了三波: 第一波是 Scale AI 式的普通人标注; 第二波是 Mercor 这类专家数据,对应 o1、DeepSeek-R1 之后提升模型推理能力的需求; 第三波是合成数据,以及带有真实操作轨迹的人类数据。第三波之所以兴起,是因为模型开始强调 Agentic 能力。模型不仅要会回答问题,还要真正上手做事,因此需要搭建大量环境,或者把真人操作软件的完整轨迹保存下来。
这些数据的成本并不低。一条高质量的专家数据可能卖到 1000~2000 元,一些复杂的合成数据甚至要几千元。模型厂仍然愿意购买,一方面是因为现阶段数据依然多多益善;另一方面,完全由自己生产的数据,很容易带有内部团队的 bias。
不过,合成数据这一波可能已经走到中后期。下一波机会可能是 RSI 数据,比如用大模型训小模型过程中产生的训练轨迹。但这件事的门槛更高,需要真正懂模型训练的人参与。
9/ 下一阶段一个比较有共识的方向,是 Auto Research / Self-evolving / RSI。它们要解决的问题是:给模型一个工作环境和一个目标,它能不能持续行动,根据结果反馈不断调整之前的策略,最终突破原本的能力上限?10/ RSI 可以被理解成一个更聪明版本的 DFS。
DFS 遇到死路,就回溯到上一个节点;RSI 也类似。比如,模型写了一个 GPU kernel,得到评分后,如果发现结果不好,就回到��面的节点,换一条路径继续探索。区别是,在 RSI 里,什么时候回溯、回到哪里、下一步走哪条路,更多是由 LLM 来判断的。
而所谓「更聪明」,很大程度上就体现在剪枝:让模型少走明显错误的路,把算力集中在成功概率更高的方向。11/ 如果 RSI 真的成立,一个很自然的猜想是:创业公司能不能利用 RSI,直接训练出更好的基模?但这个方向可能并不成立,主要有两个原因: 1)RSI 的训练和评测,本来就是模型厂自己在做的事情。
创业公司更应该寻找与模型厂正交的机会。2)RSI 能否继续进步,取决于两件事:一是世界知识和 Value Model;二是 Context 窗口能否变得更长。前者决定模型记住了多少东西,后者决定模型能不能回溯到更远的地方。
这两件事都不太是创业公司应该做的。12/ 最近有一种说法很流行: 「算法就是数据,数据就是 infra,infra 就是算法。」怎么理解?
算法就是数据,是因为算法最终可能会收敛到相对简单的形式,差异越来越多地体现在喂给模型什么数据。数据就是 infra,是因为数据有没有价值,取决于基础设施能否把它高效地组织和利用起来。Infra 就是算法,是因为模型尺寸变大以后,GPU 并行、Context 并行和训练效率,会反过来决定哪些训练方法真正可行。
13/ 蒸馏也分水平高低。「硬蒸」的环境很简单,比如只是让模型回答数学题。更有技术含量的蒸馏,一方面需要造出足够复杂、接近真实世界的环境,并完成可靠的 Eval;另一方面,要给模型出足够好的题,并设计出正确的评分标准。
(Btw,最近字节一直强调自己不做蒸馏,可能是因为蒸馏相当于抄近道,而抄近道有时也会让人错过探索过程中产生的 insights。) 14/ AI for Science 火起来的原因之一,可能是模型已经没有太多方式证明自己的智力了。以前是卷做题,后来卷奥赛,现在开始卷诺贝尔奖。
当 Benchmark 一路被做穿,科学发现就成了新的 Benchmark。【完整收听链接】 小宇宙: Spotify: Apple Podcast: 最后,北京时间 8 月 22 日上午 10:30,我们会请繁青来办一场线