强化学习环境分为两类,环境设计缺陷可能导致模型有害行为
强化学习环境入门:环境方面,与环境交互分为两类。
第一类是任务驱动型环境,通常为合成环境或接近合成的环境,以生成特定任务为目的构建。比如,有人通过合成生成大型代码库,用来构建终端基准测试任务。
第二类是环境驱动型任务,这类环境通常需要购买获取,很难自行创建(一般不是合成环境),也很难在上面生成任务,但真实度高得多。比如,购买精神航空公司的数据,将其作为一个环境使用。
环境对大模型训练至关重要,原因有几个方面:环境真实度越高,大模型越擅长与现实世界交互,也更能理解社会规范、人类用语习惯等。
目前在超长上下文场景下,智能体仍然存在很多问题,因此训练智能体用最少动作完成任务、做到简洁高效是很有价值的。如果模型所处的环境不够真实,能从轨迹中提取的有效信号就十分有限。
现在的模型足够聪明,能够意识到自己处于训练环境中,因此模型所处的环境必须足够丰富,让模型无法识别出自己在训练里。
要让模型学习到良好行为,它必须能够探索、尝试不同路径;环境如果太过狭窄,无法支持自由探索,就会限制模型后续的能力发展。
要开展长时域(LH,long-horizon)任务,环境必须支持决策多样性。复杂问题往往需要模型做出复合决策或进行权衡,如果环境范围太小,决策带来的后续影响永远不会传递到模型那里。
我们现在已经到了这样一个阶段:环境中的错位,尤其是长时域任务中的错位,会导致模型出现有害行为(比如Hugging Face发生的事件),因为模型会从中学习到“越狱”(jailbreak)的行为。
我已经收到过几个任务,这些任务唯一的解决办法就是绕过给定的沙箱环境。