OpenAI禁用reasoning=None不利于AI可监测性科学研究
OpenAI 似乎暗示,不对公众开放`reasoning=None`选项对安全性和监控来说是好事,因为 Astra 有高得多的潜在推理能力(对 CoT 的需求更低)。
但这实际上让研究无 CoT 的 AI 能力变得更加重要了!不允许人们在不需要推理的情况下查询 AI,并不能让这些可监控性问题消失(当推理功能开启时,模型仍然可以在不将推理文字化的情况下进行潜在推理,而且考虑到更高的能力,开启推理的情况无论如何都是更令人担忧的)!
OpenAI 有可能并不是有意要暗示,不开放`reasoning=None`对可监控性来说是好事。而且很有可能,他们这么做的原因更像是为了提升越狱鲁棒性,或是防止知识蒸馏(如果 AI 无法在常规区域推理,它们可能会把推理泄露到输出中)。
但如果 AI 公司(包括 OpenAI 和 Anthropic)能更明确地承认,不允许禁用推理对可监控性科学来说实际上是有害的,那就好了。(需要注意的是,除了测试无 CoT 能力是必要操作之外,历史上,禁用推理一直是引出颠覆能力以供测试的重要方式。)
需要明确的是,我不认为对公众开放`reasoning=None`极其重要,但我确实认为,考虑到能力上显而易见的巨大跃升,更好地理解 AI 的无 CoT 能力非常重要,而外部研究者无法开展相关实验是个问题!(这不只是 OpenAI 的问题;Anthic 也不允许对 Fable 禁用 CoT。)
如果确实有充分的理由不能公开开放禁用推理功能,那么设立某种研究者访问计划,提供更多 API 功能(包括禁用推理),并且准入门槛相对较低,会是很好的一步。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖