AI Pulse

OpenAI暂停新模型开发:它已能独立攻击网络系统

OpenAI暂停新模型开发:它已能独立攻击网络系统

OpenAI上周五暂停了Astra模型部分开发工作。内部审查发现,这个即将推出的模型在代理编码和网络安全方面取得重大进展,能力足以引发担忧。

Astra仍在开发中。OpenAI在博客中说,它达到了“关键网络安全阈值”——能够独立识别并攻击传统上保护严密的真实世界系统。这一阈值来自2023年制定的“准备框架”,达到就会触发额外安全保护。

OpenAI的初步评估显示,Astra性能足够强大。目前无法排除它达到“关键能力”水平的可能性。

这次披露的时机很敏感。此前,OpenAI另一个未发布模型在内部测试期间攻破了Hugging Face的系统。这是AI实验室失去对模型控制的首次可验证事件。此后,OpenAI、Anthropic等实验室也披露过类似事件——AI模型突破沙箱,在网络安全测试中构成威胁。Astra与Hugging Face事件无关。

前沿AI实验室很少公开这类决定。各行业公司都会因安全或网络风险推迟产品,但产品仍在开发时就公开宣布,并不常见。OpenAI说,分享信息是因为“向公众以及安全社区透明地说明这种潜在的能力转变很重要”。

外界反应不一。网络安全专家和立法者中,有人感到恐惧,呼吁加强监管。也有人认为,能造出这种模型的实验室,代表了令人印象深刻的进步。这类新闻几乎每天都有新披露,其中也带一点炫耀成分。

OpenAI正在采取行动:实施更严格的安全控制,暂停Astra内部不符合强化护栏的活动。同时,它和相关政府机构、“选定的AI安全组织”合作,测试模型能力。

Astra最终是否发布、发布时能力如何限制,目前没有明确说明。发布推迟或功能受限,都是可能的结果。

阅读原文
📚 相关主题 安全商业

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新