AI Pulse

AI 研究员六小时胜过人类同行,成本差近四十倍

AI 研究员六小时胜过人类同行,成本差近四十倍

Anthropic周五发布了新论文。论文展示了一套AI系统如何自动改进模型在一组对齐基准上的表现。论文标题是《Automated Researchers Can Reliably Mitigate Alignment Failures》。翻译过来就是:“自动化研究员能可靠缓解对齐失败”。研究由Anthropic研究员Chen Yueh-Han主导。这是该公司fellows项目的一次早期实践展示。

这套系统复刻了人类研究员的工作流程。它先搜索文献、提出方法,再让模型用新方法训练30分钟。基准难度在多次迭代中逐步提高。有效的方法被保留,无效的被丢弃,所以整套流程能快速、大规模地运行。系统拿到10个针对具体失当行为的基准。每个基准上的表现都有提升,模型整体性能没有下降。

论文把自动化研究员和人类研究员放在一起比了比。最好的自动化方案平均六小时内就胜过经验丰富的人类研究员提出的方法。人类指导的研究方向,也没有带来更强的性能。成本差距更直白:自动化系统的API推理成本约合每小时4美元。Anthropic给人类研究员的,是每小时150美元。差了近四十倍,同样一笔预算能支撑的实验数量完全不是一个量级。

论文认为,这些结果为“自动化对齐后训练近期可能变得实用”提供了早期证据。很多人把“递归自我改进”——让AI来改进AI——看作AI进步的下一大步。这篇论文朝这个方向迈了一步。如果模型能改进自己的对齐训练,它也能更广泛地改进训练实践。论文据此推演:到那时,人类AI研究者可能很快就过时了。

这套方法也有边界。自动化系统只在基准如实反映对齐目标时才有效。建立和维护这些基准、扩充和维护自动化研究员依赖的文献库,也都有大量工作要做。

不管自动化研究员的有效范围有多大,4美元对150美元这个成本差都摆在那里。

阅读原文
📚 相关主题 人工智能研究

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新