GPT-6 Astra被曝拿下97.6%专家级数学基准,仅一个帖子为证
两个数字目前只有帖子这一个出处,没有附带验证。
FrontierMath Tier 4 是这套基准的最高难度。50 道极难问题,由数学教授和博士后当作短期研究项目开发。基准设计者给这一层定了个标准:能解决,就说明 AI 具备科研突破所需的复杂推理。
如果 97.6% 属实,AI 已经跨过教授和博士后都觉得困难的那道坎。当然,这是设计者自己的标准,还不是独立验证。真到那一步,科研这类依赖专家判断的技术领域,可能会多出 AI 辅助的入口。
ExploitBench 的 100% 只有分数本身。帖子没说测试集多大、环境如何、难度怎样。名字指向漏洞利用,但具体测了什么,帖子里没有展开。这个满分能在多大程度上代表真实攻击能力,光凭帖子判断不了。
帖子一共 140 条讨论。有人当真:“如果这是真的,我们正在走向奇点。”有人平时不信任任何基准,这次也被数字震住了。还有人只回一句 "Sources?“。有评论问哪个是编程基准。几条评论拿 Anthropic 说事。如果成绩属实,这对 Anthropic 是一次重击,”他们应得的“。也有直接写 ”Over for Anthropic“ 的。
帖子里还带了一张价格截图,但截图内容没有出现在文字里。定价多少、和别的模型怎么比,都无从谈起。
帖子里没有任何官方信息。GPT-6 Astra 什么时候发布,也没有下文。现阶段,讨论只能停在”如果为真"上。
📚 相关主题
大语言模型