Anthropic发布递归自我改进研究论文(10)
Anthropic 刚刚发布了迄今为止对递归自我改进最清晰的预览之一。但我们依然没有讨论这件事。
昨天 Anthropic 发布了一篇研究论文。Claude 被指派去提升其他 AI 模型的对齐能力。它检索了文献,提出了方法,创建了训练数据,训练了模型,评估了结果并进行了迭代。它修复了全部 10 项测试中出现的对齐失败问题,同时没有降低测量得到的通用能力。
Anthropic 甚至用较弱的 Sonnet 5 对一个早期的 Opus 4.8 checkpoint 做后训练,在 60 小时内就让它的对齐能力接近了已发布的生产版本。
Anthropic 表示:「最好的 AAR 方法优于有经验的人类提出的方案,平均耗时仅六小时。(……) 人类引导的研究方向并没有带来更强的性能。」
这目前还不是完整的递归自我改进。被改进的模型还没有成为下一代研究者,重复这个过程。但现在这个循环的大部分已经成型了:AI 研究 AI。AI 训练得到改进后的 AI。AI 评估结果。AI 进行迭代。
当改进后的 AI 成为下一代研究者时,这个循环就闭合了。到那时进步就会开始复合增长。说实话我认为我们已经离那一步非常近了。所以请认真对待这项研究。
感谢 @tradernewsai 让我注意到这件事。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖