AI Pulse
📡 X 信号

原来强化学习给大模型带来的增益可以提前预测

在你投入一个月的GPU时间之前,你能不能算出RL实际能给你带来多少收益?这篇论文表示,你可以根据你的起始 checkpoint 来预测收益。

作者在国际象棋场景中复现了完整的LLM流水线——在 Lichess 棋局上预训练5M到1B参数的模型,用人工合成推理轨迹做SFT,再用可验证奖励对谜题做GRPO,总共扫过了36种预训练-RL组合。

信号主要来自两个预训练属性。预训练验证损失可以预测RL后的pass@1,随着参考RL计算量增加,拟合相关系数从|ρ|=0.93收紧到0.99;并且每10倍RL计算量获得的收益会随预训练token对数增加(皮尔逊相关系数r=+0.84)。

在用数学文本训练的1B参数模型上也观察到了这两种相同的模式。拟合得到的最优 frontier 显示,在50M参数规模下,RL的最优计算占比约为20%,在680M参数下为28%。随着预算增加,占比会上升但仍占少数。

机制部分才是值得注意的点。RL并不是均匀的锐化:在最难的谜题上,它能在SFT之后把正确走棋的生成概率提升到几乎不存在的水平,但同时会让模型已经偏爱的错误走棋出现频率提升数倍。

这就是为什么他们只得到了pass@1提升,却没有得到pass@16提升,也让这项研究转向了不同的方向:抑制错误模式放大,而非锐化更难题目的表现。

—— arxiv.org/abs/2607.16097 标题:"Understanding Reasoning from Pretraining to Post-Training"

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部