这项开源研究解决了大模型训练推理不一致问题
零训练推理不匹配——现在适配线性注意力,且在异步强化学习(RL)下可用 🎯
我们在 TorchTitan RL + vLLM 上实现了 Gated DeltaNet(Qwen3.5-9B / 35B-A3B)的位精确训练器/生成器一致性,然后提出了一个开源领域从未实际验证过的问题:它对异步RL有帮助吗?
就我们所知,我们实现了两个首次:
1️⃣ 首个开源堆栈在线性注意力模型上达到训练/推理对数概率差 = 0
2️⃣ 首个测量零不匹配在异步离线策略RL下的价值
实现方法比听起来简单:
• 训练器和生成器共享同一个模型定义(TorchTitan 统一模型)。不再需要逐算子对齐训练器和生成器
• 前向过程(prefill + decode + 训练)全程使用循环核,仅反向过程分块
• 关闭 split-K,使用批不变 GEMM,再加一个用于 MoE 路由的批不变 bmm
• 我们没有改动 FLA 内核内部——循环核本质就是批不变的:每个序列有自己的状态、固定顺序,不存在跨序列规约
• vLLM 的线性缓存管理+前缀缓存可以直接正常使用
📊 Qwen3.5-9B + DAPO-Math,离线策略异步设置 = 4 / 12 / 32:
• 第0步的对数概率差严格等于 0 ✅ 之后所有非零差异都来自 stale,而非精度问题
• 离线策略=32时,原生堆栈的差值会飘到 0.065 以上;我们的方案维持在 ~0.035
• 统一模型本身没有额外成本,所有开销都来自内核
• 我们也在 MoE 35B-A3B 和一个 64轮 / 64K上下文终端智能体上完成了验证
🤔 现在说句实话:效果取决于配置。在离线策略=12的数学任务上,批不变(BI)在训练奖励上领先,在保留的AIME数据集上达到了最高峰值。在终端智能体任务上它略微领先。在搜索任务和其他数学配置上,曲线几乎无法区分。
数值表现是一致的:当你扩大窗口时,BI能阻止差距爆炸。
成本:训练吞吐量降低 2–3 倍(智能体任务上约降低 5 倍)。我们的观点是:位一致性是调试工具,不是生产默认设置。开启BI跑20步同策略训练——如果差距为0但你的运行仍然出错,那就可以排除 infra 问题,bug出在你的数据或算法里。只跑20步就值得,不需要整轮全程开启。
接下来的计划:
• 降低BI的成本(消除2–3倍的吞吐量损失)
• 测试更多工作负载、更多随机种子
• 敬请关注更复杂的智能体训练方案/测试 👀
完整报告 🔗
我们和 TorchTitan 团队展开了紧密合作,我们真诚鼓励所有人去体验 TorchTitan RL。它拥有简洁高效的统一模型架构和原生异步RL设计,我们相信它是你搭建下一个RL引擎的坚实基础。
#LLM #RL #agentic #pytorch #torchtitan
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖