Xiaomi开源7k+ 强化学习任务环境(7k+)
这件事意义重大。小米刚刚开源了超过 7000 个用于训练 MiMo 的强化学习任务环境,涵盖代码、网络安全、通用工具使用、可视化网页开发和音乐相关任务。
这比单纯发布一个模型重要得多:开放权重让你可以运行模型,而开放环境让你可以训练模型。
强化学习环境很难构建,因为每个任务都需要可执行的环境、明确的目标、智能体可使用的工具,以及可靠的成功判定。小米发布了大量此前缺失的基础设施,包括提示词、智能体配置、奖励元数据,以及配套的训练框架。
现在开发者可以用它做这些事:
→ 在真实智能体工作流程上训练模型。模型不用再模仿静态答案,它可以尝试任务、调用工具、观察结果,并从结果中改进。
→ 专业化小型模型。团队可以针对软件工程、漏洞复现、知识工作或网页开发训练开放 checkpoint,不用再依赖大得多的通用模型。
→ 研究完整轨迹。每次运行都会记录智能体的推理、工具调用、环境反馈和奖励。研究人员可以确定智能体在哪里出错,比较训练算法、奖励策略、工具集和模型。
→ 构建完整训练循环。小米的技术栈涵盖环境交互、轨迹收集、奖励评估和策略优化。开发者可以替换单个组件,衡量哪些改进能提升行为。
关键转变是从开源模型输出转变为开源学习经验。数据集教模型答案长什么样,而环境让它发现哪些行动能导向成功。
前往 HuggingFace 查看吧 🤗:我写了一篇完整的分析,关于使用 GRPO 和 RULER 通过强化学习微调模型。RULER 使用大语言模型裁判对轨迹排序,因此你不需要手动编写奖励函数或收集标注答案。文章引用如下。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖