AI Pulse

GPT-6 Astra被曝拿下97.6%专家级数学基准,仅一个帖子为证

两个数字目前只有帖子这一个出处,没有附带验证。

FrontierMath Tier 4 是这套基准的最高难度。50 道极难问题,由数学教授和博士后当作短期研究项目开发。基准设计者给这一层定了个标准:能解决,就说明 AI 具备科研突破所需的复杂推理。

如果 97.6% 属实,AI 已经跨过教授和博士后都觉得困难的那道坎。当然,这是设计者自己的标准,还不是独立验证。真到那一步,科研这类依赖专家判断的技术领域,可能会多出 AI 辅助的入口。

ExploitBench 的 100% 只有分数本身。帖子没说测试集多大、环境如何、难度怎样。名字指向漏洞利用,但具体测了什么,帖子里没有展开。这个满分能在多大程度上代表真实攻击能力,光凭帖子判断不了。

帖子一共 140 条讨论。有人当真:“如果这是真的,我们正在走向奇点。”有人平时不信任任何基准,这次也被数字震住了。还有人只回一句 "Sources?“。有评论问哪个是编程基准。几条评论拿 Anthropic 说事。如果成绩属实,这对 Anthropic 是一次重击,”他们应得的“。也有直接写 ”Over for Anthropic“ 的。

帖子里还带了一张价格截图,但截图内容没有出现在文字里。定价多少、和别的模型怎么比,都无从谈起。

帖子里没有任何官方信息。GPT-6 Astra 什么时候发布,也没有下文。现阶段,讨论只能停在”如果为真"上。

阅读原文
📚 相关主题 大语言模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新