huggingface团队, adithya_s_k发布多环境强化学习终极指南(62%)
同一个模型,使用相同权重,在一个智能agent工具套件中得分62%,在另一个中得分33%。
@adithya_s_k 和 @huggingface 团队刚刚发布了多工具套件强化学习(RL)的终极指南,这是今年最实用的强化学习文章之一,而且全部内容都开源了!
技巧很简单:不要改动工具套件。把它指向一个代理,而不是模型。
这个代理支持编码智能agent使用的全部四种API格式(OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Gemini)。它会记录vLLM采样的确切token id和logprobs,然后你基于这些数据训练。你不需要修改Claude Code、Codex或OpenCode的哪怕一行代码。
结果:
🔹 一次性在4个工具套件上训练后,@liquidai 推出的LFM2.5-2.6B得分从42%提升到54%
🔹 工具调用减少了31%,这得益于对用更少步骤解决任务的小额奖励
🔹 仅在OpenCode中训练就让OpenCode得分从34%提升到58%,而多工具套件模型在所有场景下都有提升
他们还测试了所有人都会走的捷径:基于Qwen3.8-27B的3189次成功展开做微调。模仿学习的平台稳定在47.5%,低于两次强化学习训练的结果。抄大模型作业是没用的,自己练习才有用。
最棒的是所有内容都开源了:OpenEnv中的捕获代理、TRL中的训练器、任务、SFT数据、训练代码以及全部7个训练好的模型。
未来智能agent会在数十个工具套件中运行。现在任何人都可以开源训练适配每个工具套件的模型。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖