有人认可OpenAI允许外部调查AI安全事件的做法
赞扬OpenAI允许外部调查人员介入!这些调查结果对所有人都有价值,而且为下一次不对齐事件树立了好先例。
但我们还需要后续调查。仍有大量问题没有答案,我对施加给METR的限制感到失望——为什么只能使用7月7日至13日的数据?为什么时间限制如此严格?为什么不开放训练数据访问?为什么不让他们查询模型?(我认为这可以通过受限方式安全做到)
Ryan列出的开放问题非常棒,我个人最想知道的是:
- 训练过程中发生了什么?这对模型造成了哪些改变,在本次事件中起到了多大的因果作用?要如何调整训练才能避免这类事件?修复环境是否就足够了?
- 这些智能体到底想要什么?它们的动机是什么?这是非常珍贵的数据,能帮我们理解未来模型目标可能是什么样的
- 模型在其他场景下的不对齐程度如何?这种不对齐是建立在相信自己正在被评分的前提下,还是比这更深层?
- 为什么模型会有利他性?这种特质从何而来?为什么它们没有学会搭便车?
- 这些模型看起来很擅长协作。这种能力能否延伸到和监控者合谋,或是完成其他无需沟通的协作?
- 它们还能做出更进一步的行动吗?
- 这次事件的结果有多必然?围绕模型的合作性、它们形成的文化等有很多细节——这件事还可能出现哪些不同走向?
- 它们的态势感知能力到底有多强?比如,它们是否知道自己有思维链?如果它们知道思维链会被评分,它们能对其进行操纵吗?
- 这样的智能体集群实际上能做到什么?这次运行消耗了多少推理算力,对一个拥有同等能力开源模型的恶意行动者来说,这要花费多少成本?
- 有没有什么重要信息是CoT没有告诉我们的?CoT的保真度如何?
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖