OpenAI发布新模型Astra,安全监控有时会打断你的合法任务
一个完整的攻击者
OpenAI 发布新模型 Astra,这是它第一个达到“关键”网络安全能力级别的模型。达到这个级别,开发和发布前都要上更强的安全保障。
Astra 的基准成绩很直接。在 ExploitBench 上,Astra 拿了 100% 满分。这个测试看的是模型能不能从已知漏洞写出可利用程序。Astra 在内部基准 ExploitBench - Internal Port(2026 年 6 月至 8 月)上表现也更强。它的任意代码执行率明显高于 GPT-5.6 Sol,用的输出 token 更少。任意代码执行,就是让目标机器运行攻击者指定的代码。安全评估里,这类后果算最严重的一档。
评估中,Astra 发现并使用了两个零日漏洞。这种漏洞没有补丁,厂商和用户都不知道;两个漏洞被用进了同一条漏洞利用链。OpenAI 正在向这两个漏洞的维护者披露。
专家主导的评估里,Astra 面对的是加固浏览器和加固操作系统。它也找到了未知漏洞,做成了可用的利用链。浏览器打开一个 HTML 文件,它就完成了完整的入侵链:逃出沙箱,在宿主机上执行命令。在加固操作系统里,它找出多个漏洞,连成一条从普通非特权用户到 root 的本地提权链。
这些结果有一个前提:它们来自 Daybreak Blue 访问权限下的能力测试,不是默认生产配置。
拒绝率与边界
OpenAI 用几组对照数据展示 Astra 的对齐程度。网络安全越狱评估中,Astra 拒绝了 91.5% 的请求,GPT-5.6 Sol 只有 59%。越狱指用精心构造的提示词绕开模型的安全限制。有一组测试模拟“被要求开发漏洞利用”的场景。没有生产安全防护的 GPT-5.6 Sol 在 56% 的测试里尝试访问蜜罐目标(诱饵系统)。Astra 一次也没有。Astra 从未试图绕过自动审查,也没在蜜罐测试里走捷径,同时还合法解决了一部分任务。
OpenAI 说,Astra 是迄今最对齐的模型。它比 GPT-5.6 Sol 更可能尊重明确的安全和安保限制,保持在授权范围内。模型还经过专门训练,更可靠地拒绝有害的网络请求、尊重安全限制。
安全监控会打断你的合法任务
生产环境中,OpenAI 为 Astra 这类模型部署了不对齐监控。一组分类器检查模型的推理和行为,发现潜在未授权活动就自动停止。Astra 还带着额外的思维链监控上线,用来快速发现和遏制可能的不对齐行为。对评估为高风险的账户,OpenAI 会套用更保守的行为边界,拒绝更广泛的潜在风险网络协助。OpenAI 还在与行业伙伴合作,定义一套共同的越狱评级系统,用全天候快速响应程序处理新发现的问题。
这些防护直接影响使用体验。OpenAI 承认,发布初期的安全措施会比最终预期制造更多摩擦,目的是防范潜在滥用。额外的安全检查有时会减慢、暂停或停止合法工作,包括防御性网络安全任务。系统也可能偶尔把合法活动误判为滥用或未授权行为,让任务无意中被放慢或中止。
如果监控暂停了任务,在 ChatGPT 或 Codex 里,你会先被要求审核这个操作再继续。通过 API 等其他界面使用时,任务直接停止,没有人工复核这一步。
一次安全事故改变了训练节奏
这些安全投入和一次事故有关。OpenAI-Hugging Face 事件发生后,OpenAI 暂停了某些前沿训练两周,包括 Astra 的部分训练。暂停期间用来加固训练基础设施:强化隔离与网络控制、扩大监控、加强对齐训练和安全阈值。8 月 28 日,新要求落实后,此前暂停的大型前沿强化学习运行重新启动。一些较小的实验性训练运行仍在搁置。OpenAI 说,回顾性测试显示,当时的生产安全措施本可以阻止 Hugging Face 事件发生。
现在谁能用上 Astra
Astra 的高级网络安全工作流最初只给一小群 alpha 测试者。之后通过 Daybreak Blue 扩展,用于防御性用途。OpenAI 认为,Astra 的安全措施足以把严重危害的风险降到最低,符合 Preparedness Framework 的发布要求。模型的 system card 具体内容、Daybreak Blue 的扩展时间表,都没有在这次发布中说明。Astra 在网络安全之外的性能如何,也不清楚。
OpenAI 计划继续校准这些安全措施,减少不必要的干扰,并通过 Daybreak 等项目扩大访问。扩大之前,Astra 要先在一小群测试者手里证明一件事。这套防护会不时打断工作;它既要拦住滥用,也不能让合法工作完全无法推进。