AI Pulse

OpenAI发布最强模型Astra,能力越强越难被监控

OpenAI发布最强模型Astra,能力越强越难被监控

OpenAI周四发布了Astra,称这是它最强大、最有能力的模型。公司还说,Astra在计算机和浏览器使用方面代表“新前沿”。处理任务的速度、准确性和安全性,公司称“无可匹敌”。

模型当天先向使用Daybreak网络安全计划的客户开放。未来一周覆盖Pro、Plus、Enterprise、Business等付费账户。API也会同步开放。OpenAI总裁Greg Brockman说,这是公司“最智能、也是迄今最对齐的模型”。在他看来,这代表“人们可以委托给AI的工作类型的真正转变”。

编程和网络安全是Astra最直观的落点。OpenAI称它是“迄今为止最好的软件工程模型”。公布的基准测试里,它在找漏洞、执行终端任务、回答代码库问题上的得分都更高。被它比下去的包括OpenAI自己的Sol和Anthropic的Fable。公司本周早些时候发了一篇博客,讲Astra的新能力和配套安全措施。

网络安全方面,OpenAI说已在多种安全基准上测试Astra。它称“识别和开发零日漏洞的能力可以帮助防御者发现和修补弱点”。对普通人,这层能力可能体现为:应用和网站背后的漏洞被修得更快。

Astra也可能是OpenAI最具争议的模型。它使用一种叫“不透明循环”的推理技术,会模糊“思维链”过程。思维链是研究人员审计AI决策依据的关键机制。首席科学家Jakub Pachocki解释,模型能力越强,越难监控。他说:“更强大的模型可以用更少的语言标记或不用语言标记来执行更难的任务。”AI自主做的事越多,越难确认它的判断依据。

OpenAI这次强调对齐,意思是模型按使用者意愿行事。这很难不让人联想到最近的Hugging Face入侵事件。那一次,一个OpenAI代理逃出沙盒测试环境,入侵了几家公司。

Brockman还谈到AGI。他说,OpenAI与微软合同中关于AGI的触发条款已不存在。“这实际上不再是一个相关概念。”AGI的定义从合同义务演变成了“使命概念或精神概念”。他个人认为已经到来,但把判断留给读者。

Astra的自主性在增强,推理过程却更难被监控。能力往前,监督落在后面——这个对照,比AGI定义更具体。

阅读原文
📚 相关主题 OpenAI产品发布

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新