AI Pulse
📡 X 信号

Meta新论文讨论自动化研发的核心问题

Meta新论文讨论自动化研发的核心问题

我这周读了 Meta 的一篇关于研究偏好模型(RPM)的新论文,读得相当愉快:这篇论文解决了一个很多人都在思考的自动化研发问题,也就是如何让智能体在做实验时具备「研究品味」?

比如说,@eliebakouch 对 Nano-GPT 速通进行的缩放显示,智能体会被困在局部最优解中,把大部分算力预算花在调超参数上,而不是推进新想法。

类似地,PostTrainBench 显示,大多数模型聚焦于算法调优,而非管理高质量数据集(哎呀,看来智能体和研究者一样讨厌处理数据 :))。

在这篇关于 RPM 的论文中,作者们走了一条不同的路线:
- 将每个实验视作树中的一个节点
- 根据下游评估分数等指标为每个节点打分
- 变异节点来生成候选实验
- 使用 RPM(也就是 LLM-judge)选择最有前景的节点
- 运行实际实验
- 更新树并重复迭代

核心论点是,通过 RPM 引导搜索,可以省下大量浪费的实验(有点像我们之前用 PRM 引导树搜索)。

目前还不清楚,随着智能体研发能力提升,这种树结构是否还有必要,但它一个非常棒的特点是可以生成大量轨迹,这些轨迹可用于训练特定领域的 RPM,这在自然科学这类困难领域非常有价值。

这篇论文很棒,我推荐大家读一读,以便更好理解我们如何能让模型更擅长做研究!
论文链接:

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新