Meta发布关于AI智能体的研究论文
Meta 最新发表的论文指出,如果智能体永远学不会判断何时该使用内存和工具,那给它配置再多这些资源也没用。当智能体被训练去判断何时值得使用外部状态时,长期运行的智能体工作效果会更好。
EvoHarness-RL 让 Qwen3-8B 在 ALFWorld 上取得了 96.9% 的成功率,同时每个任务流程中 harness 调用降到了约1次。
长任务会让智能体忘记当前状态、已完成步骤和有用的过往经验。EvoHarness-RL 将这些内容保存在模型外,分为信念(Belief)、进度(Progress)和经验(Experience)三类。
策略网络会学习何时读取或更新这些状态,因为每次调用 harness 都会消耗一个交互步数。
带 ReAct 的 Qwen3-8B 在 ALFWorld 的见过任务拆分上得分 47.9%,EvoHarness-RL 达到了 96.9%;在未见过的任务上,EvoHarness-RL 达到 86.6%,而 ReAct 为 50.0%。
在 RL 训练过程中,频繁的状态和内存调用逐渐降到了每个流程约1次,同时成功率持续上升。常规行为似乎会被内化进模型,只在需要的时候才调用外部状态。
智能体构建者应该训练策略网络判断何时查询和更新内存,而非硬编码恒定访问。
论文链接:arxiv.org/abs/2608.05446
标题:"EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents"
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖