AI Pulse
📡 X 信号

Lobehub启动递归自我改进实验,一周后获不错结果

Lobehub启动递归自我改进实验,一周后获不错结果

七天前,我们启动了递归自我改进(RSI)实验。我们想要探索一个简单的问题:如果让 AI 智能体迭代改进它自己的框架,会发生什么?

于是我们让 Lobe Agent 整整运行了一周,使用我们的 RSI 框架来探索和优化它自己的框架。今天,我们分享实验结果。

我们使用 FrontierHarness 评估了最终得到的系统,底层模型为 Kimi K3。核心结果如下:
• 通过率 70.0%(21/30),在我们初步比较的 13 个框架中排名第一。
• 每个成功任务花费 1.68 美元,相比之下 Codex 为 3.47 美元,Claude Code 为 18.34 美元。
• 缓存命中率中位数为 86.2%,成功任务的平均完成时间为 7 分 19 秒。

这些初步结果表明,在不修改底层模型权重的情况下,框架层面的优化可能是提升智能体性能和效率的一条有前景的路径。本次比较包含选定的重试和执行环境的差异,不应被解读为官方排行榜排名。

我们计划完全开源本次实验的脚本、执行轨迹和详细技术报告,以支持可复现性和进一步研究。

在本次实验之外,我们还搭建了 Awesome-RSI,这是一个关于递归自我改进的开源研究图谱。该仓库汇集了涵盖模型层面和框架层面自我改进、自动化 AI 研究和安全领域的论文、框架、基准测试和开源项目。它已经积累了 80 多个提交,我们会持续扩展和完善这个合集。

我们认为,开放研究、可复现实验和社区协作对推动该领域发展至关重要。我们欢迎研究人员和开发者参与贡献、分享工作,一起探索 RSI。❤️ 快来尝试吧🫱

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新