AI Pulse

斯坦福推出造自我改进AI的研究生课,全部9节已上线Youtube

斯坦福推出造自我改进AI的研究生课,全部9节已上线Youtube

斯坦福大学研究生研讨课,由@achowdhery@Azaliamirh主讲,以“一线经验+论文精读”为骨架,以“构建一个能自我改进的智能体”为课程目标,YouTube已收录全部9节课程。
课程地址:https://www.youtube.com/playlist?list=PLangBM27OtEA
贯穿全课的主线:生成(大量采样)→ 验证(verifier/reward)→ 筛选(过滤正确轨迹)→ 训练(SFT/RL)→ 更强的模型→再生成。

第1讲 Course Overview — 从scaling laws到agent

三段式历史:参数/数据/算力scaling(并带来CoT等仅在大模型出现的涌现能力)→ 后训练(SFT、instruction tuning、RLHF)→ 推理侧scaling。
关键实验来自Mirhoseini实验室的Large Language Monkeys:对Llama 3 8B每题采样至10,000次并配verifier,覆盖率超过单次GPT-4o,“模型知道的远多于单次提问给出的”。o1的贡献在于将log-linear scaling从pass@k迁移至pass@1,即模型学会了在自己的多条推理链中找出正确的那条。
Agent的定义:有目标、有规划、与环境交互、依据反馈修正、知道何时停止。讲者坦率指出:现实中多数“agent”仍是人工搭建的静态工作流,只有coding和research领域出现“signs of life”。

第2讲 Test-Time Compute Scaling

三个层次:
(1) 重复采样呈幂律分布,其数学根源是数据集中存在“难题长尾”(多数题目pass@1即可解,极难题数量随难度缓慢衰减);
(2) Snell等人:ORM对比PRM、并行对比串行修订、beam search结合PRM;核心结论是易/中等题目投入更多推理算力比扩大预训练更划算,最难题仍需更强的预训练模型;
(3) Archon:将推理时技术(generator、fuser、critic、ranker、verifier、单元测试生成/评估)视为可搜索的“架构层”,用贝叶斯优化搜索,全开源模型堆叠后pass@1平均领先GPT-4o/Claude 3.5 Sonnet 14.1%。fusion单独即可超越oracle selection是一个反直觉发现。

第3讲 Robust Verification — 循环的真正瓶颈

四篇论文构成一条演进线:
Cobbe 2021(ORM,GSM8K;“大generator+小verifier”优于反之)
→ Let's Verify Step by Step(人工标注PRM800K,PRM能从正确率<5%的难题中挑出罕见正确解,OOD更鲁棒)
→ Math-Shepherd(用rollout自动标注每步“抵达正确答案的潜力”,省去人工;但对非常规解法和难题信号弱)
→ Weaver(讲者团队2025年工作:不训练新verifier,用weak supervision对一组不完美verifier加权集成,8B生成器加≤8B verifier池达到70B majority voting水平,70B级别86.2%接近o3-mini;再蒸馏成400M小模型保留97%精度)。
讲者核心判断:generation–verification gap是自我改进能走多远的决定因素;可验证领域(数学、代码)能持续复利,创意写作等领域飞轮会停转。

第4讲 Learning from Feedback with Tools/Code

三篇论文仅差一个变量——反馈来源。
ReAct:环境反馈,思考与动作严格交错,价值在于结合内部知识和外部知识(并非总是优于CoT,两者互为回退时最佳;WebShop上66.6对比人类82.1,差距仍大)。
RLEF:代码执行反馈,用public tests迭代、hidden tests给PPO奖励的双层测试防止记忆;关键消融是base model仅获得错误反馈并不受益,训练时反复暴露于反馈循环才是增益来源。
Constitutional AI:模型自我批评反馈,人仅编写原则;CAI-RL结合CoT得到helpfulness/harmlessness的最佳前沿。
讲者补充判断:让模型批评自己往往比想象中难,模型对“不知道自己不知道”过度自信,多模型共识做critique有时更好。

第5讲 Planning and Multi-Step Reasoning

LATS:将MCTS(UCT选择、LLM-as-judge加self-consistency打分、失败反思回灌)引入LLM多步任务,缺点是成本高且假设动作可回退。
SPRINT:将DeepSeek-R1的长推理链拆成依赖DAG,训练7B模型输出可并行的plan/execution,原意是减少40%串行token,意外提升约3.5%准确率,并泛化到域外。
SWiRL:离线合成多步工具调用轨迹,用LLM-as-judge打过程奖励,逐步RL;最重要发现是仅保留“过程正确”的数据(即便结果错)效果最好,且在GSM8K加计算器上训练能让HotpotQA加搜索从65提升至约75——模型学到的是“分步思考和调用工具的方式”,而非具体工具。

第6讲 Train-Time Scaling / Scaling RL

STaR→GRPO→DAPO三级递进。
STaR是“穷人版off-policy RL”:仅保留答案正确的rationale反复微调,加上“由答案反推理由”的rationalization,但会平台化,且效果上限由base model决定。
DeepSeekMath两点贡献:从Common Crawl精挖数学网页并从code模型起步(首次证明code→math迁移),以及GRPO用组内归一化替代critic,7B模型MATH超过50%。
DAPO将GRPO直接放大到Qwen-32B仅AIME 30%,四项修正(非对称clip、动态采样过滤全对/全错组、token-level loss、超长软惩罚)逐步推至50%。
讲者最重要的一句冷水:三种方法均提升maj@K而不提升pass@K——“模型更一致了,而非根本上更聪明”,OOD泛化未见提升。RL占训练算力比例从去年约1%升至约5%,但瓶颈在于reward是否足够强、足够无噪声。

第7讲 Self-Improvement and Deep Research Agents

核心命题:“正确解已在模型的输出空间里,问题是如何搜出来。”
AlphaCode:每题采样100万、用生成的测试输入聚类、提交10个,Codeforces排名54.3%;瓶颈在选择阶段(pass@k 40%以上,10@k仅约30%)。
AlphaCode 2:微调Gemini Pro家族加学习式scoring model,100个样本达到前代100万样本的水平,同预算下43%对比25%,升至第85百分位——“更强基座加更多样解加学到的打分”比堆样本有效。
Search-o1:推理链中动态检索,并加“Reason-in-Documents”模块提炼文档而非原样塞入上下文,解决agentic RAG的长上下文崩溃;Search-R1则用RL学会何时搜索。
结尾问答点出:模型聚合后普遍过度自信(50%正确却表现80%信心),校准仍是开放问题。

第8讲 Agentic Evaluations and Long-Horizon Tasks

三种评估轴给出截然不同的图景。
METR:50%成功率的任务时长视界每7个月翻倍(Claude 3.7约59分钟),但80%视界仅约15分钟,可靠性差距巨大;模型表现接近“无上下文的外包工程师”,而非领域专家。
GDPval:44个职业、约1,320个真实工作任务,对十年以上经验专家的胜率从GPT-4o的12.4%线性升至Claude Opus 4.1的47.6%,与METR的指数外推形成对照;失败主因是instruction following(承诺看参考数据却不看、幻觉覆盖)。
DeepScholar-Bench(每月刷新的related-work生成基准):没有系统总分超过19%,“英文很好但事实不全”,检索基础性论文与可验证性是硬缺口。
讲者综合判断:模型在孤立、规范明确、自身擅长的领域(软件工程、ML研究——“我们在自动化自己的工作”)表现好;对需要大量隐性上下文、模糊需求、95%可靠性的任务信心低。

第9讲 Future Research Areas

先重述自我改进循环的三个瓶颈,各配一篇论文:
(1) 推理链多样性——Multi-agent Fine-tuning用多个专门化agent辩论后微调,单模型自训练会崩塌而多模型能持续改进;
(2) 验证——DeepSeek-Math V2让verifier在无参考解下找证明漏洞,再加meta-verifier审查verifier,generator与verifier互相拉升,IMO 2024 shortlist best-of-32接近42%;
(3) 训练任务供给——Absolute Zero让模型自己出题自己解,proposer奖励设计成偏好“非平凡、非不可能”的中等难度,零人工数据在代码基准达SOTA并迁移到数学。
Mirhoseini补充“Intelligence per Watt”:ChatGPT约77%请求不需要前沿模型,本地模型可覆盖88.7%查询,两年IPW提升5.3倍,推理负载将向边缘迁移。
列出的方向还包括:可验证领域能否带动不可验证领域、continual learning、面向重复采样/多轮修正负载的推理基础设施、能源作为最稀缺资源。

9节讲座的核心

能力是潜在的,瓶颈是选择。从Large Language Monkeys到AlphaCode再到Weaver,反复出现的结论是模型采样中已有正确解,差的是将其挑出的verifier。推理侧scaling、训练侧scaling均以此为前提。
验证的可获得性决定领域的进步速度。数学、代码、形式证明有近乎免费的verifier,飞轮转得快;科学发现(验证需数天仿真或湿实验)、创意写作(主观且易reward hacking)飞轮转不动。这是课程解释“为何coding agent先成熟”的根本框架。
过程监督优于结果监督,但要防假阳性。PRM能过滤“过程错、答案对”的样本;SWiRL进一步显示“过程对、答案错”的样本反而最有训练价值。
当前RL提升的是一致性,不是根本能力。maj@K涨、pass@K不涨,OOD泛化未见突破——讲者对“RL造就新智能”的叙事保持克制。
合成数据的跨域迁移是反复出现的信号。SWiRL、SPRINT、Absolute Zero、DeepSeekMath均显示在一个可验证域训练的分步/工具行为会迁移到其他域,且大模型吸收data flywheel的能力更强。
评估必须多轴。任务时长、经济价值胜率、综合质量给出不同的趋势曲线;“一小时→几天→几周”的外推并不成立。

阅读原文
📚 相关主题 课程

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新