Alloomi披露AI Agent自主进化技术路线
大部分 AI Agent 今天已经能完成单次複杂任务。真正难的是后一半:做完之后,那些过程、判断与反馈,会不会变成下一次的能力。如果不能,系统就只是一次次重新开始。
模型可以更大、工具可以更多、上下文也可以更长,但一次任务结束后,真正有价值的经验如果没有沉淀,下一次还是得从头来。这不是记忆不够长的问题,而是「经验根本没有被写进模型本身」。这正是 Alloomi 想解决的核心问题。
现有路径的天花板 目前主流做法大致分三类: 1. 应用层套壳 / Agent Harness:接更多工具、排更複杂工作流,但底层模型能力是静态的。2. RAG / 外部知识库:能把文件、对话捞出来,却捞不出「专家为什么这样改」、「哪些风险可以接受」、「同一个判断为什么对不同客户不一样」。3. 週期性微调:成本高、速度慢,永远落后于真实业务变化。
这些方法给了 AI 更多「资讯」,却没有让 Agent 本身变得更强。知识与经验仍然停留在模型之外。真正能让一个 Agent 从「初级助理」长成「资深合伙人」的,是带有判断与反馈的真实工作经验。
而这种经验,几乎不存在于公开网路上。Alloomi 的完整技术路线是 Full-stack 模型 + 应用 的路线,把「真实工作」产生的经验,直接写回模型。整条链路由三层能力闭环组成: 1. 记得住(Holistic Context) 不是简单地把历史文本塞进 Prompt 或向量库,而是把人物、专案、文件、决策、时间变化与结果反馈,整合成可持续维护的全域上下文。
它回答的不是「发生了什么」,而是「过去如何演变成现在」。公开评测: LoCoMo-V2:97.4% LongMemEval-S:97.6% BEAM(10M 历史规模):67.0% 2. 学得会(Self-Evolving Agent) 真实任务结束后,系统会筛选可複用的经验(专家判断、修改过程、最终结果),再透过受控的后训练写入模型权重,而不是只存在外部资料库。关键不是「自己给自己打分」,而是: 专家锚定(Expert Anchoring) 品质评测与版本准入,效果监控与自动回滚 公开评测(同基座对比更具说服力): CL-Bench:从 24.5% → 47.6% CL-Bench-Life:32.1% Con.L Bench:32.6% 3. 做得成(Professional Delivery) 记得住与学得会最终都要���化为可验收的专业交付。
在复盖高经济价值职业任务、真实工作流与持续软体工程的基准上,Alloomi 都展现出可测量的提升。为什么这对投资人有意义?下一代 AI 公司的护城河,不会只是模型参数,也不会只是接了多少工具。
更关键的问题是: 用户的第二次任务,是否真的优于第一次?经验是存在资料库里,还是已经成为模型的一部分?如果模型学偏了,能不能被发现并回滚?
Alloomi 正在回答的,正是这三个问题。当经验开始在模型内部複利,每个客户的 AI 员工就会因为「做过这个客户的真实工作」而变得不可替代。这种差异化,是通用模型与外部记忆都难以複製的。
技术报告已公开: Holistic Context: Self-Evolving Agent: 开源底座 OpenContext 也可直接验证「记得住」这层能力: 让 AI 每完成一次交付,就获得一次成长。这不是口号,而是一条可被验证的技术路线。@AlloomiAI