AI Pulse

OpenAI称思维链仍可读,安全研究者:监控或被彻底破坏

OpenAI称思维链仍可读,安全研究者:监控或被彻底破坏

OpenAI 的新模型 Astra 将采用一种叫 recurrent depth 的推理技术,让模型可以在顺序思维之外运行。这套机制也叫 opaque recurrence,即不透明循环。它最直接的影响是:模型的思维链会变得更难监控。Astra 目前对这项技术的使用还比较有限。

思维链正是安全监控的重要工具。一般推理模型的思维链会按顺序写下它尝试解决问题的步骤,研究者靠它判断模型有没有跑偏、有没有做不该做的事。OpenAI 最近的 rogue agent 事件里,思维链记录就是理解代理为什么那样行动的重要线索。

不透明循环改掉的正是这条记录。模型不再走线性路径,而是循环处理同一个查询,可读的痕迹少了很多,传统思维链记录也就等于被绕开。

安全研究者的反应很直接。Redwood Research 的 CEO Buck Shlegeris 说,他对这个消息极度担忧;如果 OpenAI 继续推广这项技术,就有能力大幅增加循环,把思维链监控彻底破坏。Zvi Mowshowitz 则把它叫做玩火。在他看来,OpenAI 和 Anthropic 一直努力维持思维链的忠实度和可监控性,更密集地用这类技术会损害这种可监控性,甚至可能需要法律来阻止实验室之间的“逐底竞争”。

OpenAI 的回应是,Astra 的思维链预计仍然可读;公司也否认会转向“神经语”。OpenAI 之前已宣布过要建一套广泛的思维链监控系统;首席科学家 Jakub Pachocki 也说,从第一个推理模型开始,OpenAI 就在保留并利用思维链监控,这是当前研究计划的核心目标。

这不只是 OpenAI 一家的事。The Information 报道,Anthropic 和 Google DeepMind 已经在讨论同样的技术。Redwood Research 的首席科学家 Ryan Greenblatt 的担心更进一步:不透明推理可能比传统思维链扩展得更快,最后把所有推理都从可见渠道里移走。他最担心的是,自然发展下去,模型会完全或几乎完全在潜在空间里推理。他说,希望现在还不算太晚,能避开最让人担心的架构,也希望 OpenAI 到此为止。

经常被忽略的是,所有 AI 模型都会做一定量的不透明推理,也很少有研究者把思维链日志当作模型推理的直接表示。

阅读原文
📚 相关主题 OpenAI

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新