Meta新论文讨论自动化研发的核心问题
我这周读了 Meta 的一篇关于研究偏好模型(RPM)的新论文,读得相当愉快:这篇论文解决了一个很多人都在思考的自动化研发问题,也就是如何让智能体在做实验时具备「研究品味」?
比如说,@eliebakouch 对 Nano-GPT 速通进行的缩放显示,智能体会被困在局部最优解中,把大部分算力预算花在调超参数上,而不是推进新想法。
类似地,PostTrainBench 显示,大多数模型聚焦于算法调优,而非管理高质量数据集(哎呀,看来智能体和研究者一样讨厌处理数据 :))。
在这篇关于 RPM 的论文中,作者们走了一条不同的路线:
- 将每个实验视作树中的一个节点
- 根据下游评估分数等指标为每个节点打分
- 变异节点来生成候选实验
- 使用 RPM(也就是 LLM-judge)选择最有前景的节点
- 运行实际实验
- 更新树并重复迭代
核心论点是,通过 RPM 引导搜索,可以省下大量浪费的实验(有点像我们之前用 PRM 引导树搜索)。
目前还不清楚,随着智能体研发能力提升,这种树结构是否还有必要,但它一个非常棒的特点是可以生成大量轨迹,这些轨迹可用于训练特定领域的 RPM,这在自然科学这类困难领域非常有价值。
这篇论文很棒,我推荐大家读一读,以便更好理解我们如何能让模型更擅长做研究!
论文链接:
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖