关于持续学习时代人工智能的八个预测
我在其他地方解释过为什么我认为持续学习是必要的。如果AI被迫只能从一次会话到另一次会话地写Markdown文件,我不认为它们能像人类一样胜任完整的工作。举例说明,想象一下,学生学习萨克斯的方式是:一个学生从零开始尝试演奏,第一次练习后写下一堆笔记,然后等在音乐厅外的下一个从未吹过萨克斯的学生,在尝试之前先读完这些笔记,如此类推。即使有无限个从未碰过萨克斯的学生等在录音室外,他们可以互相传递笔记,也绝不可能通过某种共同写下的文本序列,让外面的第N个学生第一次尝试就能熟练演奏。在某个节点,你必须把经验积累进大脑。我认为对于许多我们希望AI在不同工作场所学习到的技能和知识,情况也会如此。
那么,一旦实现持续学习,AI会发生哪些变化?
许多针对AI监管的提案都假设这样一个流程:先训练模型,然后部署。因此,如果我们能在模型部署前进行一系列检查,就能确保它不会被用于网络攻击或递归自我改进。但如果基础模型每天根据它执行的数百万次会话工作而更新呢?这仅是我认为现在锁定某种监管安全机制不明智的众多原因之一。我们根本不知道一年后的技术会是什么样子,更不用说五年或十年后了,而且我们可能正在固化一种过时且可能适得其反的方法来处理AI带来的威胁。如果政府确实想对模型提供商进行某种安全评估,那么更合理的做法是进行月度或季度风险检查,而不是挑出某个在训练完成之后、部署开始之前的特殊时刻,因为将来这个类别将不再有明确的意义。
实验室的技术对齐方法必须彻底改变。几乎所有现有技术都聚焦于这样一个问题:如何让一组冻结的权重在部署期间表现良好。据我所知,关于如何保证即使在权重持续更新的情况下,AI系统也永远不会被越狱(jailbreaks)攻破,或转变成欺骗性或邪恶的人格的研究并不多。此外,如果AI还会聚合用户之间的学习成果,你如何防止用户向基础模型注入后门或某种恶意倾向?从某种意义上说,这其实更接近人类的对齐问题——你的孩子出门学习新东西,有时会被疯狂的意识形态或毒品之类的东西一击即中——但你希望自己已经给了他们足够的常识和基本价值观,让他们能够自主地完善自我,而不会最终形成某种超级怪异、反人类的信念。
AI心智的多样性将会增加。目前,显著突出的AI心智不到5个,而且由于它们大致使用相同的数据训练,彼此之间都相当相似。但如果AI从经验中学习,而不同AI的经验各不相同,我们可能会看到真正不同的AI从另一端走出来。
当部署成为训练的一部分时,领先的回报将会加速。如果你拥有最好的模型,更多人使用你的AI来执行更复杂、更有用的工作,并给予大量超出会话窗口的反馈供其整合,那么你的模型会变得更加聪明。
如果模型主要从部署中学习,实验室就会感受到更早部署其最智能模型的压力。Anthropic 从二月份起就在内部使用 Mythos。但直到六月才向公众发布该模型。在持续学习机制下,四个月的内部/外部差距意味着放弃了四个月的部署学习。你的竞争对手如果更早发布,发布当天可能不如你,但它能利用更多的真实世界经验来变得更好。
持续学习将为领先AI实验室创造一条它们目前缺乏的清晰护城河。许多人一直在问,AI实验室到底怎么赚钱?当我在播客上向Dario提出这个问题时,他用云服务商做了类比:云服务商也提供许多同质化服务,却依然能从中获得高利润率。但云服务利润率高的原因是,从一个云切换到另一个云非常耗时且昂贵。而目前,AI模型之间没有转换成本。没有什么能阻止我用Codex启动一个软件仓库,再用Claude Code完成它。但一旦实现持续学习,你正在使用的模型会在一次次会议中通过与你互动而不断改进,这时实际上就存在相当可观的转换成本。如果你想更换所用AI,基本上就像解雇一个对你的组织拥有几个月上下文了解的员工,再用一个必须从头重新训练的新人来替换。一旦被这样锁定,模型提供商就可以要求相当高的利润率。
企业会明白这一点。它们会试图避免这种锁定。但如果你面对的选择是:要么被模型提供商锁定,要么失去这个超级有价值的特性——模型能在一次又一次会话中为你不断改进——那该怎么办?如果真实使用最终成为模型改进的主要途径,那么实验室可能会补贴那些允许模型在其会话上进行训练的用户和企业,尤其是那些困难且经济上重要的工作。就像Google免费提供搜索一样。反过来,实验室可能会说,任何拒绝让其在会话上训练的企业,都将无法使用最优秀的模型。通过胡萝卜加大棒,实验室会努力让用户允许AI从经验中学习。我在这里略过了这样一个事实:更新单个用户的权重集,与将这些不同的权重分叉合并回主模型之间是有区别的,后者在技术上可能更具挑战性,但假以时日,这个问题也会被解决。
AI训练本身已经具有很大的规模经济(理论上可以预期这一点,因为你可以将昂贵的训练成本分摊到更多用户身上;实际证据是,迄今为止,实验室收入的增长速度超过了其计算能力的增长速度)。但持续学习也可能为终端用户带来推理端的规模经济,即批处理方面的规模经济——如果每个公司的信息需要完整的权重更新,而不是存放在低秩适配器中。粗略估算表明,像DeepSeek V3这样的稀疏模型,最优推理批大小大于2,400(也就是说,除非你的模型同时并发生成这么多序列,否则你的计算资源就没有被充分利用)。如果你想知道原因,请看我和Reiner Pope关于推理经济学的完整一期节目。但无论如何,这里的重点是:一组给定的权重只有在同时有成千上万个序列对其进行解码时,才能被高效地服务。一家能够产生如此多并发流量的大型公司,可以高效地服务于其持续更新的权重分叉;而一个以批大小1为自己服务的个人用户,可能会遭受100倍以上的计算效率损失。因此,提供个性化权重的经济学强烈倾向于大型组织。
到持续学习真正实现时,还会有更多变化,而最重要的变化或许正是最难预料的。但上述这些预测,即使在现在也已经清晰可见。