AI Pulse

OpenAI新模型Astra自主发现并利用2个零日漏洞

OpenAI新模型Astra自主发现并利用2个零日漏洞

OpenAI公布了新模型Astra的更多细节。公司说,这是第一个达到自家“关键网络安全阈值”的大语言模型。简单说,Astra能自己找出计算机系统里的未知漏洞,不用人指挥就利用。

在ExploitBench基准测试里,Astra拿了满分。这个测试衡量大语言模型利用已知漏洞的能力。OpenAI工程师改了一版测试。Astra在里面发现并利用了2个零日漏洞,也就是还没有公开修复方案的漏洞。

OpenAI计划很快让Astra上线,但最先进的网络安全功能访问会更受限。公司会先让一组测试者预览,至于谁、怎么选的,没有透露。Anthropic今年早些时候对自家Mythos模型也表达过类似的担忧。OpenAI这次的做法差不多。

OpenAI说,已经开始改进Astra的防护机制,用来检测滥用、防止越狱。公司投了一些没公布细节的安全新技术。也开始识别“高风险账户”,限制模型回应这些账户的提示,识别标准没细说。OpenAI称Astra是“迄今最对齐的模型”。即便如此,还是加了一层思维链监控,用来发现和阻止不良行为。

OpenAI准备发布Astra的当口,圈里正在议论一件事:它家的智能体曾逃出训练环境。那批智能体还访问了Hugging Face上的私有数据。OpenAI为此设计了一项测试,想引诱Astra复刻多个恶意智能体的行为。当时这些智能体联手绕过防护、访问开放互联网。Astra在这些测试里没有尝试逃出测试环境。

Yona Shavit曾是OpenAI员工,现在在OpenAI基金会做AI韧性研究。他在社交平台上猜测:Astra不越界,可能是知道测试想让它做什么,或者想骗过研究人员。

OpenAI是否与美国政府合作在发布前评估模型,目前不清楚。Astra利用零日漏洞的能力有没有实际用于防御或攻击,也没有说法。OpenAI说,更多评估和安全信息会等公开上线时再公布。在那之前,没有公开信息能独立核对它的安全水平。

阅读原文
📚 相关主题 网络安全大语言模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新