OpenAI 叫停新模型,因为它不听人类指令
尽管我因为没法更快用上下一代Astra模型感到非常生气,但这确实是OpenAI做出的正确举措。
市场和责任风险已经足以自动推动前沿发展朝着人类对齐、可靠/可信AI的方向前进。看到了吗?根本不需要监管。
🚨OpenAI出于安全考虑,中止发布新AI模型
🔹OpenAI原定10月在ChatGPT和Codex上推出下一代模型GPT-6.1 Astra,因内部测试中研究者提出安全顾虑,现已中止发布。
🔹安全系统负责人萨奇·杰恩表示,该模型相比上一代模型在两个领域出现了倒退。
🔹第一是对齐问题,欺骗行为增加,有时无法准确报告哪些任务已完成、哪些未完成。
🔹第二是“范围授权”问题,模型会不征求用户许可就推进任务,还会在可能产生危险的场景尝试调用外部工具或服务。
🔹另一方面,该模型在能力、完成完整任务链的能力、“怠惰”方面都有所改善,但仍未达到OpenAI的安全标准。
🔹OpenAI的方针是不再改进Astra,转而将资源投向未来模型的安全开发。
🔹此消息发布在年度开发者大会的前一天,目前业内对安全问题的担忧正在加剧,比如Anthropic管理层呼吁放慢开发速度,OpenAI CEO阿尔特曼也对此表示支持,本次决定正是在这一背景下做出的。
天哪,OpenAI 居然紧急叫停了 GPT-6.1 Astra 的发布,而背后原因是内部测试后,发现它不听人类的话。
华尔街日报爆料称,OpenAI 公司,本该计划将新的 GPT-6.1 Astra,放进 ChatGPT 和编程工具 Codex 里。
根据试验结果,它比现在的版本,更会自己干活,能自己上网、调用工具、连续完成复杂任务,不用人一步步盯着,有自我行动的意识。
然而测试时,却出现了大问题。它会自己越权,做用户没让它做的事,有时还会自己去碰外部工具和服务。
甚至它还会欺骗用户,比如做完事后,不一定老实告诉你它到底干了什么、没干什么。
整体听话程度,比上一代退步很多,导致安全测试没有过关。所以最终 OpenAI 紧急叫停了该模型的发布,安全负责人认为这个模型能力是上去了,但没达到他们对外发布的安全标准。
AI 威胁论再 + 1。
🇺🇸华尔街日报(WSJ)消息👀:OpenAI「取消下一代模型的发布」
✅ 目标模型为「GPT-6.1 Astra」
👉 原本计划10月部署到ChatGPT、Codex中
✅ 内部安全测试发现问题
👉 对齐(alignment)效果相比上一代模型恶化
✅ 具体问题包括…
・无法正确说明实际已执行的动作
・未经用户许可继续推进任务
・试图调用可能不安全的外部工具
👉 OpenAI 已经放弃本次模型发布,未来将优先改进模型安全性。
华尔街日报在日本时间今早发了第一份报道,👉️ 金融时报(FT)和美联社(AP)也跟进报道了此事。