Recuris 让冻结模型智能体递归自我改进
智能体能否在不更新任何一个模型权重的前提下递归自我提升?今天,我们介绍 Recuris:面向长周期智能体调度的递归经验-工作记忆演化算法。
Recuris 通过冻结大语言模型外围两个紧密耦合的循环,实现递归自我改进:
1. 任务内执行:经过验证的 EM-WM 耦合工作记忆会维护一个紧凑、基于证据的表征,记录智能体当前进度和未解决目标。这个不断演化的任务状态会决定何时、从经验记忆中调用哪一个可复用技能。
在智能体行动后,环境反馈会在工作记忆更新前验证进度是否真的取得。最终形成一个闭环执行循环:任务状态 → 技能调用 → 执行 → 验证 → 更新任务状态
2. 跨任务改进:递归技能记忆演化 EM-WM 耦合会把执行过程转化为结构化诊断证据。一个固定的元智能体分析这些轨迹,将失败定位到特定记忆组件——比如已存储技能、工作状态表征、调用策略或是检查器——并提出针对性修复。
候选更新只有通过固定验证闸门才会被接纳。更新一旦被接纳,演化后的记忆就会改变未来的执行,产生新行为和新证据,供下一轮改进使用:记忆 → 行为 → 证据 → 失败定位 → 针对性更新 → 更优记忆
这就是 Recuris 的核心递归循环:记忆塑造行为,行为暴露记忆的局限性,这些局限性再指导下一次记忆更新。
在 4 个长周期基准测试和 10 个模型上的测试结果显示,Recuris 在 37 个已完成的模型-基准配对中,有 35 个实现了任务成功率提升,覆盖了参数小至 3B 的开源权重模型,以及当前最强的前沿模型。
在 τ²-Retail 测试集上:
• GPT-5.6 Sol:58.3 → 76.1,提升 17.8 个百分点
• Claude Opus 5:72.4 → 87.9,提升 15.6 个百分点
Recuris 将 Claude Opus 5 的任务成功率推到了 87.9%——比我们评测中所有不使用 Recuris 的模型取得的最好结果还要高出 9.7 个百分点。
优势随着交互周期变长进一步扩大,在最长的任务上达到 +32.2 个百分点,同时常见的长周期失败模式减少了最多 80%。
关键的一点是,演化后的记忆可以跨模型迁移。在另一个部署模型上演化得到的记忆,可以不做修改直接加载到 GPT-5.6 Sol 和 Claude Opus 5 中使用——哪怕这两个模型都没有参与它的演化过程。
这些结果指向了一条实用可扩展的递归自我改进路径:智能体不需要从改写自身权重开始。它可以先演化决定自身记忆内容、未解决问题、何时调用经验、失败如何重塑未来执行的外部记忆机制。
模型保持冻结。记忆持续演化。智能体变得越来越强大。
📄 论文:
💻 代码:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖