OpenAI试验让模型隐藏思考的新技术,研究者警告或越安全红线
红色警报:OpenAI即将跨越AI安全红线。
The Information刚刚爆料,OpenAI正在试验一种新技术,该技术会让模型更少暴露其“思考”过程,从而使其更难被监控。正如Zack Korman和我几天前在这里所论证的,更好的监控是本来可能阻止Hugging Face事件的因素之一——OpenAI自己也承认这一点。而他们正在探索的新技术可能使这种监控变得困难甚至不可能。
去年,一个全明星阵容撰写了一篇引人入胜的论文,如今读来格外切题,题为《思维链可监控性:AI安全的一个崭新而脆弱的机遇》(Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety)。我完全同意其中高亮部分:他们说得完全正确。思维链(CoT)监控并不完美(正如Subbarao Kambhampati等人所示),但它仍然是我们监控那些被称为LLM的巨型黑箱所能拥有的最好线索之一。这是一条纤细的线索,但为了(微不足道的?)性能提升而牺牲它,感觉像是一场危险的游戏。今晚早些时候,Guidelight.ai的Steven Adler——也是众多离开OpenAI安全团队的研究者之一——说了下面这番话,呼应了Nathan Calvin:
Steven Adler (@sjgadler):如果这是真的,OpenAI似乎正在违反AI行业仅存的少数红线之一。绝对不要这样训练你的模型——这到底是怎么回事??
Nathan Calvin (@_NathanCalvin):今晚来自The Information的报道真是巨大且极其令人担忧。看起来OpenAI在Astra中利用了一项neuralese的突破,可能会摧毁思维链的可监控性——尽管The Information的消息源告诉他们,OpenAI目前正在“限制使用 https://t.co/hVfR0DGWPw”
我完全、百分之百同意。
P.S. 给那些喜欢终结者梗的人:
Jesse Singal (@jessesingal):我们这是在求着被天网端掉呢。
Stephanie Palazzolo (@steph_palazzolo):OpenAI的Astra AI使用了一种名为“循环深度”(recurrent depth)的新推理方法。虽然它有助于降低成本和提升性能,但研究人员担心它掩盖了模型的思考过程,使其更难监控。与@amir @rocketalignment共同报道 https://t.co/ksprupu2h5