AI Pulse
📡 X 信号

蚂蚁集团发布灵3.0 Flash,开源大模型参数效率登顶

Ant Group 刚刚发布了 Ling 3.0 Flash,这是一个 124B 参数的开放权重模型,在 Artificial Analysis Intelligence Index 上得分 38。

Ling 3.0 相比上一代有显著提升,在开放权重模型的「智能水平 vs 总参数量」帕累托前沿上占有一席之地。

@AntGroup 发布的 Ling 3.0 Flash 是一个开放权重推理模型,总参数量 124B,推理时激活参数量为 5B,上下文窗口为 262K token。它在 Artificial Analysis Intelligence Index v4.1.1 上得分 38,比上一代 Ling 2.6 Flash(非推理模型,14分)高出 24 分。

这个得分和 MiMo-V2.5(38分)、Qwen3.6 27B(38分)持平,而激活参数量仅为 MiMo-V2.5 的三分之一。它目前落后于开放权重快速层的领先者 DeepSeek V4 Flash 0731(推理,最大努力),后者得分为 52。

主要结果:
➤ Ling 3.0 Flash 位于开放权重模型「智能水平 vs 总参数量」的帕累托前沿上。在总参数量低于 124B 的开放权重模型中,没有任何模型在 Artificial Analysis Intelligence Index 上的得分比它更高;而总规模相近的 gpt-oss-120b(117B)得分 24,落后 14 分。前沿上排在它下一位的是 MiniMax-M2.7,该模型总参数量 230B,得分 39。

➤ Ling 3.0 Flash 在智能体能力上实现了显著提升。Ling 3.0 Flash 在 τ3-Bench Banking 上得分 27%,在快速层开放权重模型中排名第二,落后于 DeepSeek V4 Flash 0731(推理,最大努力)的 39%,领先于 Hy3(23%)和 Inkling Small(19%)——后三者在 Intelligence Index 的得分反而比它高 3 到 4 分。在 GDPval-AA v2 上,它的 Elo 评级达到 1108,相比 Ling 2.6 Flash 的 545 有显著提升。

➤ Ling 3.0 Flash 在 Aa-Omniscience 上有显著提升,但提升几乎完全来自拒绝回答,而非知识本身。

Ling 3.0 Flash 在 Artificial Analysis Omniscience Index 上得分 -18,相比 Ling 2.6 Flash(非推理模型)的 -66 有所上涨。基础准确率仅从 16% 提升到 18%,错误答案的幻觉率从 97% 下降到 44%,答题率从 99% 下降到 56%。Ling 3.0 Flash 回答的问题少得多,但它答题时产生幻觉的概率也低得多。

➤ Ling 3.0 Flash 位于相近参数量开放权重模型中「智能水平 vs 价格」的帕累托前沿上。在 inclusionAI 官方 API 中,Ling 3.0 Flash 的定价是每 1M 输入 token 0.075 美元,每 1M 输出 token 0.22 美元,是我们测试过的所有在 Intelligence Index 得分 38 及以上的模型中,每 token 成本最低的。

然而,这个优势在「每任务成本」维度被削弱了,因为运行 Intelligence Index 测试时,Ling 3.0 Flash 用了约 2.4 亿输出 token,总成本 73 美元。按每任务 0.02 美元计算,它落在「智能水平 vs 每任务成本」帕累托前沿的内部,而非前沿线上。

额外模型细节:
➤ 规模:总参数量 124B,激活参数量 5B
➤ 上下文窗口:262K
➤ 定价:每 1M 输入 token $0.075,每 1M 输出 token $0.22,缓存命中可享 80% 折扣
➤ 许可证:MIT
➤ 提供方:inclusionAI 官方 API 和

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新