AI Pulse
📡 X 信号

解读当前AI递归自我改进RSI研究进展 附可用Prompt

解读当前AI递归自我改进RSI研究进展 附可用Prompt

最近有很多关于 RSI(Recursive Self-Improvement,递归自我改进)的讨论,也让大家开始担心,AI 会不会不断升级自己,最后超出人的控制 我周末集中看了一批 RSI 2026 年的论文和公开项目,想把几个问题讲清楚:现在到底发展到了哪一步,业界 popular 的讨论是什么,以及我们普通人能怎么用。最后我会给大家一个可以用来直接给 AI 实现初步 RSI 的 Prompt 这次按方向来聊,论文和项目放在对应段落,大家可以收藏下来慢慢看 1/ 先分清楚,大家说的“自我改进”,有三件不同的事 第一件,AI 根据反馈,把当前任务再做一遍。第二件,它把有效经验、工具或工作流程留下来,下一次任务也能用上。

第三件,它进一步改进“下一轮怎么学习、怎么做实验、怎么选方案”这套方法。越往后,接手的研发决策越多。9 月 10 日发表的的《The Last AI Built by Humans》把这些自主范围拆成了执行、策略、经验获取、环境适应和元改进几层,适合当阅读地图 2/ 今年一条很密集方向研究线,是让 AI 改自己的 Harness Harness 可以理解为模型周围那套实际干活的系统:读哪些文件、给模型看什么上下文、怎么调用工具、失败后怎么恢复、什么时候算完成。

今年 3 月的 Meta-Harness,6 月首发、8 月更新的 Self-Harness,以及 7 月底的 DarwinX (Salesforce),都在研究怎样把这套系统交给自动实验来优化 3/ 另一条已经出现企业内部应用的路线,是把人的纠错变成持久经验 今年 1 月的 MemRL,把经验和“这条经验实际有多管用”一起保存。下次先找相关经验,再根据使用效果挑选,而不只是找文字最相似的记录 到了 9 月 2 日,Meta 公开了一个更贴近日常工作的内部案例:专家纠正 Agent 后,系统会判断错误来自知识缺口还是处理流程,把纠错转成文件修改,重放原来的问题、跑回归测试,再交专家审核。通过后,这次失败还会进入以后的测试集。

这是 Meta 在特定专业领域的内部实践 对我们普通用户来说,这一条就很有用了, 人的一次纠错,开始有机会变成后续任务都能使用的改进 回到关键问题,我觉得今年这些工作的共同价值,是让我们开始认真维护一个会积累经验的系统。所以我们现在可以怎么用?篇幅有限,我把一个我们都能用上的效仿 RSI 的基础 prompt 放在评论区里, 我最近也在观察,每次任务留下什么,每次纠错改到哪里,下一次能否因此做得更好,这些都已经可以在自己的工作里动手验证了。

为了防杠,我得说明一下:这三个方向只是工程向的,硅谷大佬们担心的更多是研究向的内容。这些内容比较硬核,研究向 RSI我会在后面帖子里单独去聊

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新