AI助手越用越懂你,开源项目Reef让它边服务边进化
现在市面上的 AI 助手,生命周期基本固定:训练、评估、部署。然后一直跑同一个版本。想更新,得等厂商发新版。推理就是流水线的终点,用户在对话里产生的数据,不会回头影响模型。
一个叫 Reef 的开源项目直接挑战这个前提。推理不再是终点。代理在运行时留下经验:执行轨迹、结果、用户反馈。这些被收集起来,成为下一轮学习的材料。提示词、记忆、技能、工具、编排逻辑,都能从经验里改进。
Reef 管这个叫持续自我改进。它比 RSI(递归自我改进)更宽、更实用;RSI 是同一思路更彻底的递归形态。
把想法落地,得重做基础设施。Reef 从实时推理出发。它提供标准推理端点,兼容 OpenAI API 格式。现有应用不用改代码就能接入。每次推理的响应头里带一个记录 ID。应用拿这个 ID 把反馈挂回对应的那次交互。轨迹和反馈被存成结构化的经验流。系统顺带处理三件麻烦事:过时经验、会话合并、去重。
经验流本身不会自动变成进步。Reef 用学习配方决定怎么用这些经验。配方管三件事:流怎么处理、用哪种学习算法、什么时候评估和部署更新。不同改进策略拆成三个维度——学习信号、经验获取、进化目标。在线强化学习、测试时训练、技能进化、harness 进化、自对弈,都能做成配方。想用哪个,在 serve.yaml 里配好,启动服务时生效。
Reef 把代理看成两部分:模型,和模型外面的整套 harness。harness 包括提示词、记忆、技能、工具调用、流程编排。两者紧紧耦合,必须一起进化。改进分两条轨道:一条改模型,一条改 harness。
harness 侧,Reef 用 Cordis 当训练后端。典型的 harness 进化配方会分析代理轨迹和用户反馈,提出修改。改完的版本打包成可安装更新,发布出去。这像给代理打补丁——补丁可能是新提示词、工具配置或编排逻辑,不一定动模型权重。
模型侧完全异步。学习配方持续读取记录、更新权重。训练在服务照常运行时进行,后端改编自 Slime。候选模型通过评估、获批部署后,Reef 发布新版本。新权重通过 NCCL 同步,热更新进服务引擎,不用重启。
越学越差的风险在部署环节被卡住。候选更新必须通过评估,才能替换当前工件。被拒绝就保持原样,通过则发布成可审计的新版本。每个场景有一条追加式发布链。发布头用 compare-and-swap 推进,过期发布者覆盖不了新版本。模型权重这类大文件由 Git LFS 管。
官方展示的两个配方,路线完全不同。OpenClaw-RL 走在线强化学习。用户正常对话,模型在后台被 Reef 异步进化,不打断用户。交互轮数越多,代理越懂用户偏好,回答越合口味。TTT-Discover 走测试时训练。它迭代改进 Packing 32 的打包方案。更有效的解不断被发现、保留,打包分数逐步上升。两个方向在 Reef 里都能跑。
项目在 GitHub 上开源。目标:让开源社区容易实验持续自我改进,直接拿到生产级基础设施。Reef 不把自己定位成单纯训练设施,而是从实时推理出发、支持整个代理进化的系统。社区可以自己写学习配方、接入现有代理,项目有 Discord 讨论群。
有几个问题目前没答案。用户反馈和会话轨迹存在哪里、是否加密,Reef 没提。持续异步训练要消耗多少算力、普通开发者扛不扛得住,没有参考数字。评估具体怎么做、多轮进化后代理会不会出现不可预测行为,也没有回答。Reef 的学习信号来自真实交互,用得越深的用户,贡献的训练信号越多。