AI Pulse
📡 X 信号

Agentic RL 基建综述对比11家公开技术报告

做 Agentic RL 基建,最贵的成本往往不是算法,而是“等”。

一条轨迹动辄几百步却只有最终一个二值结果;StepFun 实测 search agent 里 5% 的样本吃掉 80% 的生成成本;MiMo 的 25 个数据源之间,平均生成 token 数相差 90 倍、活跃时长相差 66 倍。

这篇综述梳理了 11 份公开技术报告(MiMo / DeepSeek / Kimi / GLM / Qwen / MiniMax / StepFun / LongCat / 蚂蚁 / Seed / 混元),把路线摊平对比,给出了一个挺完整的判断框架:
🧭 四个平面:Control(调度/版本/容错)、Data(轨迹/logprob/reward 流转)、State(KV cache、环境状态、partial rollout)、Weight(新权重向推理引擎的同步与切换)
🛠️ 底座已收敛:Megatron-LM 训练 + vLLM/SGLang 推理 + Ray 编排——各家自研的是其上的 agentic 编排与解耦层
🛤️ 六条主流路线:
① 共卡 + 掩码纠偏
② 异步 + partial rollout + staleness 管控
③ 序列级 IS(GSPO 系)绕过 MoE 路由回放
④ 专家化—再蒸馏 / 多教师在线蒸馏
⑤ critic 回归 vs 无 critic 组相对
⑥ 环境即基建

几个最硬的事实:
• 训推不一致不是精度小问题:MoE 的离散专家选择会被微小数值差翻转,GSPO 论文实测每次更新约 10% 的激活专家发生变化
• 参数热更新是分离架构的命门:蚂蚁 AState 用零冗余 P2P,10 秒同步万亿参数、达 sub-second 更新
• 沙箱已经是重资产:Kimi AgentENV 基于 microVM(checkpoint/resume 低至 133ms/49ms),累计创建 5,100 万+ 沙箱;Qwen 造了 80 万真实 PR 实例 + 85 万合成 bug 任务
• reward hacking 是真的:MiMo 加上 AST 检查后,通过率从 97.9% 掉到 27.9%——那 70 个点全是假的

全文最有价值的一段是它对“分歧”的总结。核心张力就一句话:
是花力气让系统逼近理论上干净的 on-policy(bitwise 对齐、严格 staleness、路由回放),还是接受工程现实的脏乱、用算法鲁棒性(序列级 IS、掩码截断、二值接受)把偏差吸收掉?

目前看,后者占上风,但系统层对齐并未退场,两者大概率长期共存。

还没解决的问题也列得很清楚:共卡 vs 分离无定论、staleness 上限无统一标准、routing replay 存废、critic 到底值不值、process reward 划不划算、长程信用分配仍未解决。

可以预见,谁能率先把「长程信用分配」与「环境噪声鲁棒的可复现大规模合成」这两块最硬的骨头啃下来,并在模型-harness-环境的协同设计上形成闭环,谁就能在下一轮 Agentic 智能的竞赛中握住先手。

做 RL infra、后训练、agentic 系统的朋友,这篇值得收藏当参考手册 👇
#RL #AgenticRL #Infra #后训练

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新