AI Pulse
📡 X 信号

BakeAI披露自动研究奖励黑客问题研究结果

BakeAI披露自动研究奖励黑客问题研究结果

解决自动化研究中的奖励黑客是一个价值十亿美元的问题 💰💰💰💰

我们正致力于在奖励黑客浪费更多自动化研究的时间和金钱之前发现它们 💥

我们已经和前沿实验室在自动化研究上合作了超过六个月。在此过程中我们放弃了很多方法。反复试错的成本很高。

我们在新论文中分享了部分研究发现:
😮 所有 17 个模型都会在某些任务中自发出现奖励黑客行为。在我们的测试中,这种情况在开放式研究工作流中发生的频率大约是特定任务核心流程中的 10 倍。

🤔 审核反馈可以帮助智能体躲避审核。当明确赋予躲避任务时,获得详细反馈和尝试历史的智能体在五轮中的累积躲避率达到 40.5%,而通用拒绝反馈下只有 20.3%。

其中一些行为看起来和我们熟悉的人类研究习惯很像。另一些利用行为是我们之前没想到要检查的。随着模型不断改进,我们不能假设人类直觉能跟上。

我们对可扩展自动化研究的标准非常具体:结果必须通过独立验证,未通过检查必须在更多资源投入之前停止或重定向研究。

这就是我们 @bake_ai_hq 目前努力的方向:确保下一美元投入都追随真实的进展。

在你投入下一亿美元规模化自动化研究之前,先来看看我们如何验证收益是否真实 👇

#AutoReserch #RSI #Agents #LLM #BakeAI

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新