强化学习之父直指当前LLM根本不是真智能
强化学习之父理查・萨顿最近接受红杉专访,抛出了一个让整个 AI 圈不舒服的问题: 现在的大语言模型,训练完权重就 “焊死” 了。它们不会从交互中学习,不会因为新经验而改变自己。它们只是在调取训练数据,然后用上下文补全。
这不是智能。这是高级检索。萨顿说,持续学习才是智能的核心本质。
人类大脑一直在修改权重 —— 从每一次交互、每一个错误、每一条反馈中学习。而今天的 LLM?出厂即巅峰,之后只会衰退。
RAG、长上下文、LoRA 微调 —— 全是在绕开这个根本问题。这就是为什么萨顿和学生创立了 Oak Lab。也是为什么越来越多团队意识到:基础模型的能力曲线正在趋平。
下一个分水岭不是谁的参数更大,而是谁的 AI 能在真实世界里持续变强。这是一个还没有人真正跑通的、万亿美元级的问题。很多团队在攻这个方向。
学术派有 Oak Lab,产业派里我最近在看 Alloomi。他们的思路是:不在实验室里造 “会学习的模型”,而是让 AI 先去真实业务里干活,再把实战经验写回权重。应用 + 模型,全栈闭环。
拆解一下他们的四层架构: ① 全局上下文 —— 不是读静态文档,是把对话、人员、决策、反馈、时间线全部打通,看懂整件事的来龙去脉。② 自进化记忆模型 —— 把专家判断、修改记录、客户反馈筛选后通过后训练写进权重,而不是只存在外部数据库里。③ 专家锚定 —— 学习过程对齐专家示范和高质量交付标准,防止模型乱学、错误越积越多。
④ 可控安全进化 —— 质量校验、实时监控、自动回滚。每一轮更新都可核查,漂移了能及时撤回。这四层合起来,解决的是一个核心矛盾:怎么让 AI 持续变强,又不变得不可控。
在最近9项相关的Benchmark中,Alloomi达到或接近 SOTA 。Alloomi 的观点我很认同:基础大模型���厂能力人人都差不多。真正拉开 Agent 差距的,是它在你的业务里日复一日沉淀下来的专属判断力与实战经验。
通用智能是起点。行业经验才是护城河。萨顿在专访最后说,我们离真正的持续学习还有很长的路。
但方向已经清晰了: 未来的 AI 公司,卖的不是一个静态模型,而是一个每天都在变强的系统。谁先跑通 “做完任务 → 沉淀经验 → 模型变强 → 产出更好结果” 的飞轮,谁就拿到了下一个时代的入场券。智能只是起点。
经验,才是 AI 的分水岭。@AlloomiAI