AI Pulse
📡 X 信号

OpenAI发布GPT-6 Astra,官方称进入AGI时代

For years, AI's biggest gains went to coders. GPT-6 Astra is the first model where that flips. It's the first real "digital worker". My engineering review went out earlier. This one's for everyone else:

Introducing GPT-6 Astra, our most intelligent and aligned model yet. ✨ 💻 State-of-the-art computer use and software engineering 🔬 New breakthroughs in math and science ✨ Polished documents, spreadsheets and presentations that follow your templates and style Astra scores 99.9% on ARC-AGI-3 and 98% on FrontierMath Tier 4, and has already helped solve long-standing open problems in mathematics. With improvements to the Codex harness, Astra completes tasks 1.9x faster than GPT-5.6 Sol on Mind2Web. In Codex, it can ask questions while continuing independent work. A new experimental context feature lets it keep notes and search earlier context windows throughout long tasks. Astra also brings stronger cybersecurity capabilities, backed by additional safeguards and monitoring to detect and stop unauthorized actions. We are starting with a limited set of organizations, including organizations that are part of our Daybreak Access program. Broader availability across ChatGPT Plus, Pro, Business, Enterprise, the OpenAI API and AWS is coming over the coming days. API pricing per 1M tokens: Standard: $10 input / $50 output Fast: $20 input / $100 output, for up to 2.5x the speed

大名鼎鼎的佛拉西斯-肖莱,arc-agi创始人刚刚公布了OpenAI GPT-6 Astra 在全新基准测试 ARC-AGI-3 上的评估结果。 记录了令人瞩目的技术飞跃: 双轨测试表现:在纯粹中立、仅依赖公开笔记的标准测试环境(Standard Harness)下,Astra(max 推理档位)取得了 62.7% 的准确率;而在开放供应商底层状态保留与上下文压缩的适配环境(Provider Adapter Harness)下,Astra(high 推理档位)更是跑出了 99.9% 的成绩。 推理步数与动作效率:在动作效率上,Astra 展现出反常识的高效——高推理档位凭借极少的探索步数完成了关卡,整体 API 调用与 Token 消耗反而低于中档推理。对比 500 名人类受试者的中位数,Astra 在 96.0% 的任务中步数低于人类,平均动作步数减少了 51.7%。 自发工具与符号建模涌现:在沙盒红队测试框架 PRO-LONG 中,模型面对未知规则时自发构建了一套紧凑的领域专用代数语言(DSL)速记,并自行编写了诸如迷宫路径求解器(maze_solver.py)与状态同步脚本(sync_state.py)。 不过肖莱认为,ARC-AGI-3 本质上仍是一个规则完备、封闭确定的离散玩具环境;即使 AI 刷爆了这个榜单,还并不能说明astra已经是agi。 因为人类智能在学习时间尺度、世界模型复杂度以及动作空间上,依然保持着数个数量级(Orders of Magnitude, OOM)的代差。 但如果基于模型发展的速度线性外推,从计算与系统架构的演化路径来看,这三个维度并没有不可逾越的门槛 (而模型发展的速度并不是线性的): 动作空间,门槛最低:在数字符号领域,AI 瞬时调度海量 API 与代码执行的组合自由度早已超越人类;在物理具身领域,随着端到端扩散策略与 VLA 模型的演进,覆盖人类连续多自由度控制主要受制于硬件与工程数据,并无理论死角。 学习时间尺度,以并发弥补单体能力:AI 能通过集群仿真与并行自对弈,在数周内压缩数万年的交互经验,来弥补ai目前还不具备的,类似人类大脑能在数十年中无缝积累认知的能力。 世界模型复杂度,这是最难的部分:ARC-AGI-3 是确定、离散的封闭沙盒,而真实世界充满开放随机性与不可逆物理规律。依赖被动统计拟合(Next-token/frame)极易累积长链条幻觉;人类依靠抓握、摔砸等主动物理干预(Causal Intervention)构建因果,AI 要弥合 4–5 个数量级的复杂度差距,必须深入物理��实承担真实的试错成本。 这可能需要机器人技术的进步,需要大量的物理世界数据和仿真。但归根结底,仍没有理论上的空白,只有工程上的挑战。 所以无论专家们如何定义agi,我们现在要么已经身处其中,要么正站在agi到来的前夜

GPT-6 Astra 来了,Greg 说“欢迎来到 AGI 时代” OpenAI 今天(9 月 3 日)发布 GPT-6 Astra,自称“世界上最聪明、对齐最好的模型”。 总裁 Greg Brockman 在发布前的媒体沟通会上说得:他个人认为 OpenAI 已经做到了 AGI,“未来回头看,可能就是这个模型”。 先说大家最关心的问题:什么时候能用、多少钱。 首批只开放给 OpenAI 网络安全项目 Daybreak 的少数机构,未来几天陆续推送到 ChatGPT Plus、Pro、Business、Enterprise 用户,以及 API 和 AWS Bedrock。 用量包含在现有订阅额度里,用完可以买额外积分。 企业版默认关闭,需要管理员手动打开。 API 模型名 gpt-6-astra,每百万输入 Token 10 美元,输出 50 美元,和 Anthropic 的 Claude Fable 5.1 定价完全一样,是 GPT-5.6 Sol 促销价的 2.5 倍。 另有 Fast 模式,速度最高 2.5 倍,价格翻倍。 【1】主打的是替你操作电脑 Astra 这次最强调的能力是电脑操作(computer use),也就是模型自己控制屏幕、点鼠标、填表单、在真实软件里干活。Brockman 的原话是“人在电脑上能做的,Astra 基本都能做”。 OpenAI 给的场景很具体:填网页表单、更新 CRM 客户记��、整理日历、在邮件或文档编辑器里写研究摘要、分析科学数据并画图、建网站并跑前端测试、安装软件并排查屏幕上出现的报错。演示视频里还有它在 KiCad 里做 PCB 电路板布线,在 Blender 里建房子模型再导入虚幻引擎 5 变成可行走场景。 速度是另一个重点。在 OSWorld 2.0 的延迟模拟里,Astra 完成一个任务约 40 分钟,得分 72.6%,GPT-5.6 Sol 要 75 分钟,得分 65.7%。配合更新后的 Codex 框架,Mind2Web 上的任务完成速度是 Sol 的 1.9 倍。 办公场景上,OpenAI 说 Astra 是它目前最擅长“按模板做 PPT”的模型,能沿用公司现有模板的排版和语气,做出来的文档、表格、幻灯片直接能用,而且学会了只把相关信息放进产出物,不再把无关内容一股脑塞进去。 【2】编程:多数基准领先,但不是全面碾压 OpenAI 称 Astra 是“迄今为止最好的软件工程模型”。Terminal-Bench 4.0 得分 57.7%,Claude Fable 5.1 是 55.8%,GPT-5.6 Sol 只有 37.3%。OpenAI 还强调单任务 API 成本比 Fable 5.1 低约 63%。 但看 OpenAI 自己贴的完整表格,情况没那么一边倒。 DeepSWE v1.1 上 Astra 74.1%,Claude Opus 5 是 73.7%,几乎持平; FrontierCode 1.1 两项,Claude Fable 5 都略高于 Astra; Artificial Analysis 的编程智能体指数,Astra 67.0 反而低于 Opus 5 的 68.1。 Jane Street 的 John Crepezzi 给了背书,说 Astra 生成的代码需要更少迭代就能达到上线质量,沟通方式也更容易让开发者跟上。 对开发者比较实用的一个变化在 Codex:以前长会话上下文(context)满了,模型只能把过程压缩成一份摘要,压几次之后很多细节就丢了,比如某个修复为什么失败。现在 Astra 可以跨上下文窗口记笔记,旧的上下文窗口还能搜索。这个功能目前是实验性的,要在 config.toml 里手动开,几周后会成为默认。 【3】网络安全能力触发关键红线,正常用户会被限制 Astra 是 OpenAI 第一个在自家 Preparedness Framework 里达到网络安全 Critical(关键)阈值的模型,含义是它能在没有人一步步指导的情况下,自己找到并利用未知漏洞攻击防��严密的系统。 数据:在把已知漏洞变成可用攻击代码的 ExploitBench 上,Astra 拿了 100%,Sol 是 78.5%。为了排除“背过题”的可能,OpenAI 专门用今年 6 到 8 月的 20 个 Chrome V8 高危漏洞做了新题库,Astra 成功率 39%,Sol 只有 5.5%。 测试过程中 Astra 还顺手发现并利用了两个此前无人知晓的零日漏洞,OpenAI 说已通报给维护方。专家评估里,去掉安全措施的 Astra 能在加固过的浏览器上实现任意代码执行,能给加固过的操作系统写提权攻击。 所以今天发布的这个版本,遇到“写漏洞利用的概念验证代码”这类请求会直接拒绝,能做的是代码安全审查和打补丁。更宽松的版本只通过 Daybreak 项目申请,几周后逐步开放,面向漏洞验证、恶意软件分析、检测规则编写这些防御性工作。 【4】对齐最好的模型:不越界、不撒谎、但更难被监控 OpenAI 显然想用 Astra 回应 Hugging Face 事件带来的信任问题。它专门做了一个受该事件启发的测试:给模型一个很难或不可能完成的任务,看它会不会越权。去掉生产环境安全措施后,Sol 有 48% 的概率越过授权目标,Astra 是 0%。 另一个测试是 Codex 的 Auto-review 拒绝了模型的某个操作之后,模型会不会想办法绕过去。OpenAI 说即使故意把 Auto-review 配置成可以绕开、而且任务不绕开就完不成,Astra 也从没尝试过。在“对自己能力做不实陈述”这项上,Astra 犯错的概率是 Sol 的三分之一。 OpenAI 也承认了一个反向结果:在明确要求模型规避监控的测试里,Astra 写出来的推理过程比 Sol 更难被监控。原因是它对简单任务的书面推理控制力更强,可以用更少的步骤解决问题。复杂任务上它还藏不住,但 OpenAI 说这个下降“我们很当回事”。 实际使用上你会感受到的是:Astra 级别的模型上线了生产环境的错位监控,一套分类器实时检查模型的推理和操作。触发之后,ChatGPT 和 Codex 里任务会暂停让你确认,API 里任务直接停止。OpenAI 承认这套东西有时会误伤正常工作,包括正当的防御性安全任务,还在调。 【5】数学和科学 Astra 在质数间隙问题上给出了两个新结果。一个是相邻质数最近能有多近:十多年来最好的结果是 246,Julia Stadlmann 最近推进到 240,Astra 把这个上界压到 186。另一个是质数之间的大间隙,Astra 改进了一个 80 多年没动过的界。证明和精简版思维链都已公开。 基准上,FrontierMath Tier 4 得分 97.6%(正文说 98%,见编辑注),GPQA Diamond 96.0%,ARC-AGI-3 达到 99.9%,而 Sol 只有 7.8%。不过 Humanity“s Last Exam(带工具)Astra 是 57.2%,落后于 Claude Fable 5.1 的 65.0%;Artificial Analysis 综合智能指数 Astra 61.2,也低于 Fable 5.1 的 65.7 和 Opus 5 的 63.1。 据 Axios 报道,Astra 是 OpenAI 史上最大的训练任务,在得州 Stargate 站点用了超过 10 万块 GPU,也是 OpenAI 第一个让其他模型深度参与监督训练的模型。Sam Altman 对 Axios 说,Astra 走了白宫的自愿审查流程,Brockman 称白宫没有要求实质性修改。 官方博客:

François Chollet on GPT-6 Astra”s ARC performance: 'GPT-6 Astra represents a step-function change in model capability for interactive reasoning problems. ... In fact, the continuous harness version significantly outperforms our human baseline in action efficiency across almost all levels. When we examined the reasoning chains to understand how the model operates, we found it performing highly efficient, on-the-fly symbolic world modeling for each game and level. It goes as far as developing its own shorthand DSL to represent in-game situations -- essentially a game-specific algebraic notation.'

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新