构建智能体,强化学习环境就是全部需求
作者此前曾在社交平台发布观点称,RL环境对重复性智能体(RSI)来说就是全部需求。此次作者进一步拓展观点,该结论不止适用于RSI,构建智能体时,RL环境就是你需要的全部。
回顾深度学习发展历程,上世纪六七十年代,研究人员认为通用人工智能(AGI)近在眼前,当时主流方向是手工构建规则启发式的专家系统。1966年推出的Eliza是专家系统类聊天机器人,曾被看好,最终被证实完全无法实用,整个领域进入AI寒冬。
神经网络的出现带来了系统化解决问题的方法。模型不需要手工编写规则,而是学习近似目标问题的分布,只需要整理数据集、投入算力训练即可。
模型性能会随规模提升而变好,这不仅催生了深度学习,也让学界和业界充分理解了算力扩张的重要性,也就是广为熟知的“苦涩教训”。
机器学习领域最终形成了一套固定方法:整理数据、拆分为训练集和测试集,用训练集训练模型,再在测试集验证泛化能力。这套方法被大量机器学习工程师广泛应用,改变了世界。但这套对应方法在智能体领域还不存在,目前需要解决的核心问题是,如何借助算力构建智能体。
具体来说,核心问题包括两个:智能体的数据是什么?智能体的组成是什么,又该如何利用算力?
对于智能体而言,对应深度学习中“数据”的就是RL环境。我们正从“知晓知识的模型”转向“能在环境中执行任务的智能体”,智能体在RL环境中训练,因此RL环境就是智能体的新数据。RL环境名称中的RL是多余的,只是这类环境最初被用于强化学习研究,训练智能体不一定非要使用强化学习方法。
智能体本质上就是大语言模型(LLM)搭配适配框架与系统提示词。前沿实验室主要投入资源更新大语言模型,多数开发者更关注更新提示词,适配框架工程目前也开始受到关注。接下来可以看如何借助算力更新这三类组件。
更新大语言模型的方法很直接,可以用RL更新模型权重,也可以用监督微调(SFT),或是用环境生成的轨迹进行中间训练。目前前沿实验室已经在使用这套方法,实验室外也有不少成功案例,可以训练大语言模型适配定制化智能体场景。这个过程就需要用到RL环境。
更新系统提示词方面,目前多数开发者都手工编写提示词,这种方式对复杂智能体效果不佳。未来会逐渐转向用GEPA、自动搜索等工具寻找适配的最优系统提示词。
人类手工写提示词,比不上能完成检查、反思、编写操作的大模型,这正是“苦涩教训”的再次体现。这类搜索优化方法需要系统统计提示词的表现得分,拆分训练测试集,在训练集迭代、在测试集验证泛化能力。这些工作都需要高质量RL环境才能完成。
更新适配框架是一个比较新的领域。目前人们还在手工迭代适配框架,作者认为未来会出现自动化构建适配框架的机制,适配框架本质上就是一段程序。目前已知最相关的研究是Meta-Harness相关工作,明年可能会有更多相关成果推出。而迭代适配框架的最优方式,就是针对具体使用场景准备一套RL环境。
除了训练智能体,RL环境还可以用来完成系统化评估,替代目前常用的主观感受式评估。比如Snowflake首席执行官对比GLM-5.2与Opus 4.7时,就用到了103个面向dbt的RL环境。
总结这套逻辑:传统机器学习方法是整理数据,借助算力在数据上训练模型。新的智能体开发方法是整理RL环境,借助算力完成一项或多项操作:更新模型权重、更新系统提示词、更新适配框架。哪怕不做训练,也至少可以用RL环境完成评估。
构建智能体离不开RL环境,但目前行业对整理RL环境的投入普遍不足。这也是bespokelabsai专注于RL环境研究与产品开发的原因,无论是实验室还是企业,开发或评估智能体时,RL环境都是全部需求。作者下一次将讨论RL环境对软件和重复性智能体(RSI)的意义。