企业AI Agent要自我进化,得先把日常工作变成安全训练数据
这是一篇关于自进化智能体的优秀论文。
企业级智能体无法真正实现进步,除非它们杂乱的日常工作能转化为安全的学习数据。未来的企业智能体或许可以在修改底层模型之前,通过更新内存来实现进步。
当前的问题在于,已部署的智能体会产生大量有用的行为轨迹,但开发团队通常只能通过缓慢的人工检查、提示词修改、重新训练和重新部署来改进它们。
论文提出了一个由三部分组成的机制:第一,以可直接用于学习的共享格式记录智能体的每一步操作;第二,使用数据代理来清理、管控、存储和重放智能体的真实工作;第三,使用控制层来决定要更新内存、技能、提示词、工具还是模型权重。
AREAL 2.0 展示了这个思路的一个精简版本:在线智能体的 LLM 调用会被路由到一个在线强化学习服务,这样真实交互产生的轨迹就可以用来训练未来的模型更新。
作者认为,目前的主要缺口是一套能将智能体活动转化为可用学习数据的系统,而不是又一个精巧的优化器。
未来的智能体需要安全、可重放的方式来更新内存、技能、提示词、工具或模型,同时不会失控。
----arxiv.org/abs/2607.01120v1 标题:《Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents》
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖