AI Pulse
📡 X 信号

Hugging Face 披露多框架强化学习新研究

Hugging Face 披露多框架强化学习新研究

Hugging Face 刚刚填补了 harness 工程领域的一个重大空白!这是多 harness 强化学习的终极指南。

同一个开放权重模型在某个 harness 中表现良好,但迁移到另一个 harness 后就会准确率下降,或是生成无效的工具调用。

出现这种情况的原因是,在单一接口中训练会让模型学到该接口特定的工具名称、输出格式、上下文结构和控制流。模型学到的是如何操作 harness,而不只是如何解决任务。

Hugging Face 的研究者测试了一种更具可移植性的方法,叫做多 harness 强化学习。他们没有通过单一智能体接口训练模型,而是通过 Claude Code、Codex、OpenCode 和 Mini-SWE-Agent 进行训练。为了实现这一点,他们连接了三个开放系统。

→ OpenEnv 在智能体 harness、强化学习环境和训练器之间提供了标准接口。它的捕获代理位于 harness 和模型服务器之间,记录训练所需的准确 token 和生成概率。

→ Harbor 在容器化任务上运行智能体。它保持任务、harness 和沙箱相互独立,允许在不重建环境的情况下通过不同 harness 尝试同一个任务。

→ TRL 是 Hugging Face 用于大语言模型后训练的开源库。它使用 OpenEnv 捕获的轨迹,通过强化学习更新模型。

真正的突破在于训练数据的捕获位置。每个 harness 都保留了它原生的工具、提示词、上下文管理、重试和执行循环。研究者没有在训练器中重新实现这些行为。OpenEnv 观察穿过每个真实 harness 的模型调用,将它们转换为可用的训练序列。

团队在全部四个 harness 上训练了 LFM2.5-2.6B。首次尝试就解决留存任务的比例从 42.2% 提升到了 54.2%,每个 harness 都有提升。训练后的模型在它和基模型都能解决的任务上,工具调用量也减少了 31%。

只在 OpenCode 中训练也能提升模型,但提升大部分都集中在 OpenCode 里。多 harness 训练将提升分散到了各个接口中。

本次实验只使用了一个任务族、一个训练随机种子和不对等的数据曝光,因此结果不是通用排名。即使有这些局限,其机制仍然很重要。开源模型不能假定只部署在单一接口上。如果它们需要在不同 harness 间工作,这种可移植性必须成为训练的一部分。

如果你想了解 harness 工程以及智能体 harness 到底包含什么,我写了一份完整的解析来帮助你入门。文章引用如下。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新