AI Pulse

GPT-6 Astra漏洞利用基准满分,综合智能指数与上代持平

OpenAI 今天开始向有限数量的组织推出 GPT-6 Astra。接下来几天,ChatGPT Plus、Pro、Business 和 Enterprise 用户都能用上。OpenAI API 和 AWS 也可以调用。API 里的模型标签是 gpt-6-astra。OpenAI 公布的基准中,Astra 在大多数指标上高过 Fable。

Astra 最直观的变化在长对话。OpenAI 的八针基准测试里,它在 256K 到 512K token 上下文下得分 100%。512K 到 1M token 下得分 96.3%。换句话说,一次性塞进超长文档、来回追问多轮,关键信息不容易丢。不过这是厂商自测,真实场景能不能复现,需要独立验证。

安全攻防是更突出的能力。ExploitBench 漏洞利用基准上,Astra 得 100%,上一代 GPT-5.6 Sol 是 78.5%。ExploitGym 上它得 42.4%,Sol 是 30.3%。SRE-Bench 二进制逆向工程任务里,Astra 四次尝试内得分 99.2%,Sol 是 68.7%。差距不是小修小补,安全分析类工具可能因此获得明显更强的自动化能力。

但综合智能没有全面领先。Artificial Analysis 的 Intelligence Index 里,Astra 得 61 分,和 GPT-5.6 Sol 相同。比 Claude Fable 5.1 低 5 分,也低于 Meta 刚发布的 Muse Spark 1.3。单项强不等于全面强。在 Coding Agent Index 上,Astra 最大努力下成本与 Sol 相当,得分高 2 分。每任务成本不到 Fable 5 的一半,得分却相同。对编码任务来说,它是当前性价比更高的选择之一。

Astra 最亮眼的分数也要看测试条件。ARC-AGI 3 基准上,Astra 拿到 99.9%。但这个成绩是 OpenAI 在自定义框架 Provider Adapter 下跑出来的,成本 1.9 万美元。默认设置下,得分降到 62.7%,成本 2.6 万美元。这个自定义框架会在请求之间保留不透明的推理状态,用压缩处理更长的对话。模型因此能复用先前的工作。Claude Fable 5 还没公布 ARC-AGI 3 成绩,99.9% 没有直接可比对象。默认条件下的 62.7%,说明标准场景的推理表现和宣传分数有不小距离。

价格和 Claude Fable 5、5.1 完全相同。每百万输入 token 10 美元,每百万输出 token 50 美元。更强的安全和长上下文能力,没有抬高价格。

安全攻防能力增强,滥用风险也随之累积。OpenAI 没有说明如何约束这种能力。真实场景中的长对话和推理表现,还需要独立验证。

阅读原文
📚 相关主题 大模型产品发布

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新