AI Pulse
📡 X 信号

2.6B小模型 训练后成功率提升12% 工具调用减31%

2.6B小模型 训练后成功率提升12% 工具调用减31%

哇,这篇文章写得真好!想搞懂 Agent、Harness和 Post Train到底怎么连起来,一定要读这篇最终指南,我认真读了一遍,收获很大 《The ultimate guide to multi-harness RL》讲了一个很实际的问题:同一个模型,为什么放进 不同的 Harness, Claude Code、Codex、OpenCode,表现会差这么多?又该怎么训练,让它在不同框架里都能更好地完成任务?

看完你能搞懂这几件事: 1/ 模型、Agent、Harness、RL 环境到底是什么关系。Harness 就是模型外面负责组织上下文、执行工具、控制任务流程的那层程序。它改变了模型能看到什么、能做什么,也就改变了最终表现 为什么只在一个框架里训练,换个框架就可能出问题。

模型可能记住了某套工具名称、参数格式和重试规则。换个地方,连工具都调用不对,原本会做的任务也做不好 2/ 怎么让真实的 Agent 框架接上 RL 训练。文章把 OpenEnv、Harbor、TRL 怎么配合讲得很细:任务在哪里跑,模型生成的数据怎么记录,最后怎样变成训练样本。

连“为什么不能只存聊天文本,还要保留原始 token 和生成概率”这种容易忽略的细节都解释了。3/ 怎样同时训练“做对”和“少走弯路”。奖励怎么设计,怎样鼓励模型做对任务又少调用工具,以及模仿大模型的 SFT 和根据自身尝试学习的 RL,���这组实验里有什么区别。

文中有个很直观的实验结果:在 SmolDataEnvs 数据分析测试中,2.6B 的小模型经过四种框架联合 RL 训练,平均任务成功率从 42.2% 提升到 54.2%;在训练前后都做对的任务上,工具调用减少了约 31%。我最喜欢的是它的讲法:先把概念讲明白,再用交互图一步步展示一次任务怎么跑完、数据怎么送进训练,后面还有代码和实验对照。想把 Agent 和 RL 真正串起来理解,这篇很值得收藏慢慢看

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新