AI Pulse
📡 X 信号

现在大模型越来越难聊,居然和RLVR训练有关

如果你一直在用最新的前沿大语言模型,你几乎肯定现在已经注意到,更新的模型变得更难对话了:它们更像机器人,满嘴行话,输出冗长啰嗦,还会做你没要求它做的事。

这一切是怎么发生的?嗯,我不是训练这些模型的人,所以我不能百分百确定,但我已经了解了足够多的证据,可以做出有依据的推测,而且我觉得把它作为现代大语言模型训练流程的速成课分享出来会很有意思。那我们开始吧。

让我们把时间倒回2020年。GPT-2和GPT-3已经发布并广泛可用,但它们一次只能预测一个token——这就是大语言模型的核心。token预测可以通过API获取,但当时没有什么是你能“与之对话”的。

所以,尽管它因为涌现出的智能在学术界引发了大量兴奋,它并没有得到大规模普及。2022年,ChatGPT改变了一切。催生出ChatGPT的研究工作最初来自一个名叫InstructGPT的模型。

它以GPT-3作为智能底座,使用人类反馈强化学习(RLHF)来教模型如何“聊天”。RLHF的核心思路是,你让模型生成几个回复,然后让真实人类选出他们更喜欢哪一个。不断重复这个过程,你就能得到一个知道怎么聊天的模型。

值得注意的是,早在InstructGPT阶段,研究就发现,让模型对话体验更愉悦会降低它们纯粹的学术能力。这被称为“对齐税”,这是个有意思的点,我们稍后再回来说它。

后来人们开发了各种技术来减少对人类的依赖,但最终奖励模型还是以人类偏好为基础,让这些AI助手更容易对话。所以请记住:RLHF = 训练模型让人类喜欢。

2024年,claude sonnet 3.5带来了一个拐点,它是第一个差不多能自主完成编码任务的模型。它催生了第一波可用的“编码智能体”。

sonnet 3.5实现这一点的方法是,用一个带有bash和文件编辑工具的框架(现在叫做智能体)训练模型,把智能体扔进虚拟机,给它一个任务,让它尝试完成。

这些任务都预先定义了机器可验证的结果,大多通过测试用例实现,可以验证模型是否真的完成了任务。然后你让模型在这类虚拟环境中进行数十亿、数十亿次尝试,其中一些会偶然成功。

你保留成功的智能体会话,用强化学习训练模型更多地这么做,然后大功告成——你就得到了一个编码智能体。这个方法叫做可验证奖励强化学习(RLVR)。

如果你仔细看,你会发现,在这个RLVR流程里,模型最终输出的文本回复完全不重要,只要智能体写的代码能通过测试就行。哪怕它说话像个混蛋,它依然会得到奖励。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新