NVIDIA开源Molt:轻量可扩的智能体训练框架
来自 NVIDIA 的智能体优先 RL 训练框架!Molt 是专为智能体研究构建的原生 PyTorch RL 训练框架。
整个技术栈由三个组件构成:用于部署和异步队列的 Ray,用于生成 Rollout 的 vLLM,以及用于训练的 NVIDIA AutoModel + FSDP2。就这么简单。
智能体优先的设计意味着,奖励可以是你写的任意 Python 代码。数学评分器、LLM-as-judge、多轮工具评估器、VLM 环境,都可以。你只需要在「Env」或「ChatAgent」类中定义「好」的标准即可,不需要预训练奖励模型。
它提供两种智能体接口,覆盖不同工作流。「Env」接口是 Gymnasium 风格的——框架掌控 LLM 循环,你的 `step()` 返回奖励。「ChatAgent」接口通过 OpenAI 或 Anthropic SDK 给你提供循环,因此任何已经兼容这些 API 的外部工具链无需修改就能使用。
这个技术栈在设计上刻意保持极简。只有一个可训练 actor,可选 KL 参考 worker,完全异步的 rollout 和训练重叠。RL 代码总量约 8.6K 行,相比之下 verl 有 62K 行。体积小到可以从头到尾读完,理解每一个梯度。
训练 8B 模型的同一份脚本,可以扩展到 1T 级 MoE。DeepSeek-V3 级的 actor 可以在 `ep_size 256` 下运行,支持 TP、EP、CP 并行,加上 Adam CPU 卸载。不同规模之间不需要重写代码。
支持的算法:REINFORCE、REINFORCE baseline、RLOO、GRPO、DR-GRPO、GAE (PPO),以及同策略蒸馏。
核心能力:
• 奖励可以是任意 Python 函数——评分器、LLM-as-judge、多轮工具、VLM 环境
• 完全异步的 rollout、训练和权重同步重叠
• 同一份脚本即可支持从 8B 到 1T 级 MoE 扩展
• 两种智能体接口:Env(Gymnasium 风格)和 ChatAgent(OpenAI/Anthropic SDK)
• 完整支持 REINFORCE、RLOO、GRPO、DR-GRPO、GAE、同策略蒸馏
100% 开源。我已经把链接分享在回复里了!
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖