AI Pulse
📡 X 信号

研究者发布Recuris研究方法

研究者发布Recuris研究方法

冻结的 LLM 智能体还能在长周期任务上持续提升性能吗?能——只要进化的是记忆,而非权重。

今天我们介绍 Recuris:用于长周期智能体调用的递归经验-工作记忆进化算法。

当智能体处理更长的任务时,常见策略是将技能和流程积累在记忆中,随任务推进进行检索。但长周期执行会在两个地方破坏这套逻辑。

第一,检索性能会下降:初始指令已经无法描述当前问题,不断增长的历史会混杂已完成步骤、过时信息和噪声。第二,改进是盲目的:记忆更新只由单个下游分数决定,这个分数只会告诉你哪里出问题了——不会告诉你是什么出了问题。

于是我们构建了 Recuris:智能体会对照已验证的任务状态使用自身经验,并且根据状态留下的证据改进经验。

技能调用不再需要搜索完整历史。工作记忆会追踪哪些目标已经完成、哪些仍待处理;只有得到环境反馈支持的状态变更才会被确认,技能会基于仍未完成的目标从经验记忆中调用。

每一次运行都会留下一条结构化轨迹,连接任务状态、技能、动作和观测。基于这条轨迹的故障定位准确率达到 64.8% ——仅依靠结果的定位准确率只有 13.0%,低于始终猜测的基准线 33.3%。

固定的元智能体只会修复轨迹指向的组件,更新由留出验证做门控。被接受的更新会改变未来的执行,为下一轮提供新证据——整个过程中基础 LLM 始终保持冻结。

在 4 个长周期基准和 10 个模型上的测试显示,在全部 37 组模型-基准配对中,Recuris 提升了 35 组的任务成功率。

在 τ²-Retail 上,GPT-5.6 Sol 提升了 +17.8 个百分点,Claude Opus 5 提升了 +15.6 个百分点,最终准确率达到 87.9%——比所有不使用 Recuris 的模型中的最好结果还要高出 9.7 个百分点。

📄 论文:💻 代码:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新