AI Pulse

AA三天改两次新基准,被指为让Astra打平Fable,DeepSeek却拿了第一

三天改了两次

AA 上周发布了一个新基准。它是 Intelligence Index v4.3 更新的一部分,取代了原来的 τ³。榜单刚出来,评论区就有人质疑——不是冲着第一名,而是榜单本身三天改了两回。

Astra 在新基准上刷了大量分数,拿这些分数跟 Fable 打平。有评论说,AA 两次改动就是为了让 Astra 看起来不比 Fable 差。结果,第三方模型 DeepSeek V4.1 Flash 直接拿了第一。有评论把这件事概括成一句话:“AA 改了两次评测,就为了处理 Astra 和 Fable 之间的观感,然后一个第三方模型走进来拿了第一。”

第一名的问题也不少

DeepSeek V4.1 Flash 在同一份榜单的幻觉基准上也名列前茅。“可惜的是,它同样登顶了幻觉榜。”有评论者称它“benchmaxxed”,意思是它在刷基准分这件事上做到了极致。同一个评论给出的幻觉率是 90%+。这个数字来自评论区,没有第三方验证。

Minimax M3 在幻觉基准上的位置就好得多,幻觉率更低。

还有评论说了一句“钱还没到账呢”,暗示排名背后可能有其他推力。这句话无从证实。另一条评论说的是:“不该信任单一基准,尤其当所有模型都在彼此的误差范围内的时候。”

榜单上,DeepSeek 的 4.1 和 5.3 Flash 在多数任务里和前排模型打平。所谓前排,就是 Opus5、Fable、Astra、Sol。但在文本、翻译这类“软”任务上,它们明显差一截。这个观察也被别的测试印证。一份综合排名会把一堆不同维度的得分压成一个数字,可挑模型的人需要回答的是具体任务。

自己动手测模型

除了看榜,评论区也有人动手测模型。

一位用户的做法是在模型的原生环境里测试,看它们在机器学习代码上的实际表现。他会拿一个模型的输出,喂给 Astra、Fable、K3 等几个模型交叉审查。这样能避免让某一个模型的判断成为最终答案。

他还给了一个具体技巧:用带 MCP 工具函数时,先让模型对所有 MCP 函数跑一遍测试,把预期行为和实际行为的差异记下来。这一步做完,模型用 MCP 的能力提升了一大截。他建议所有人都试试这套做法。

他还解释了一个现象:大厂模型在代码任务上普遍表现好。K3、Gemini、Astra、Fable、Opus 背后的公司都在内部用自己的模型写代码。这种日常使用本身就是持续训练的一部分,外部评测很难复制。DeepSeek 在他的经验里也属于 ML 代码表现不错的一类。Gemini 3.8 Flash 平时风评一般,但在原生环境里跑 ML 代码任务表现很好。他丢给它一个 Godot 的 MCP 环境,它也应付得来。

他举过一个反例:GLM Flash 刚出来时,大家为它疯狂。当时它还叫 Ox Alpha 之类的名字,实际测试并没有宣传的那么好。

他同时提醒,评测和实际使用是两回事。“这些是活在别人服务器上的巨大模型,不在你的本地电脑上。”评测是闭门的,用的是封闭权重和 API,没有人真正知道测了什么。这一点让整个榜单体系显得不太牢靠。

其他细节

讨论里还提到两件小事。有人注意到 Muse Spark 实测表现很好,速度快得反常。他猜模型本体很小,希望 Meta 能像当年开源 llama 那样把它放出来。Ornith 和 Laguna 两个模型至今还没被测试。评论区有人猜测是怕 Qwen 粉丝反弹,但没有证据。

几周后会有一波新的模型和基准,一位评论者说,届时所有讨论都会变得非常非常过时。

阅读原文
📚 相关主题 大语言模型行业动态

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新