OpenBMB发布MiniCPM5-2B 小参数量大能力
OpenBMB 的 MiniCPM5-2B 在 Artificial Analysis Intelligence Index v4.2 上得分 15,是所有总参数不超过 4B 的开权重模型中得分最高的。
OpenBMB(@OpenBMB)是开发 MiniCPM 系列高效小模型的开源 AI 团队。
MiniCPM5-2B 是一个总参数 2.6B 的稠密推理模型,支持文本输入输出,以 Apache 2.0 协议发布。
MiniCPM5-2B 在该智能指数得分 15,仅比拥有约 3 倍总参数的 Ling 3.0 Tiny(得分 16)低一分。在所有总参数不超过 4B 的开权重模型中,排名第二的是 Granite 4.2 3B,得分 11。
主要结果:
➤ 是所有总参数不超过 4B 的开权重模型中智能指数最高的,在智能水平 vs 总参数曲线上设立了新的帕累托最优点:它的得分 15 比 Granite 4.2 3B(11)高出 4 分。总参数为 2.6B,比参数多 44% 的 Qwen3.5 4B(推理,预估得分14)高 1 分,和参数约为它 4 倍的 Qwen3.5 9B(推理,预估得分15)打平。作为稠密模型,它的尺寸优势体现在内存占用,而非激活参数计算量。
➤ 在这个尺寸下拥有强大的智能体性能:它在 GDPval-AA v2 的 Elo 分是 831,领先所有参数<4B 的模型;在 τ³-Banking 上,它和 Ling 3.0 Tiny 并列第一,达到 21%,而下一位最佳模型 Granite 4.2 8B 仅为 8%。在 AA-Briefcase 上,它在对比测试的模型中排名第二,Elo 分 438,高于 Granite 4.2 8B(324),仅低于 Ling 3.0 Tiny(485)。
➤ 知识、代码和长上下文是它的短板:MiniCPM5-2B 在 Humanity's Last Exam 排名第七(9%,落后于得分为 16% 的 Gemma 4 12B(推理)),在 Terminal-Bench v2.1 排名第八(9%,落后于得分为 29% 的 Qwen3.5 9B(推理)),在 CritPt 得分为 0%。在 SciCode 测试的五个模型中排名第二,得分为 26%,落后于 Granite 4.2 8B(31%)。在 AA-LCR v1.1 得分 59%,在测试集中排名第五,比 Ling 3.0 Tiny(60%)低一分。在我们新推出的专业文档推理评估 GDP.pdf 上,它直接通过了 1% 的任务,落后于得分为 2% 的 gpt-oss-20b(high)。
➤ 它的 AA-Omniscience 得分 -12 来自于不回答而非准确率:MiniCPM5-2B 仅尝试回答 29% 的 AA-Omniscience 问题,不幻觉率达到 78%。它的准确率为 8%,比 Ling 3.0 Tiny(9%)低一分,是 Qwen3.5 9B(推理,16%)的一半。尝试回答更多问题的同类模型会被重罚,Qwen3.5 9B(推理)得分为 -53,gpt-oss-20b(high)得分为 -63。
➤ 作为推理模型,它的 token 效率很高:每个 Intelligence Index 任务,MiniCPM5-2B 平均使用 19k 输出 token,和 Granite 4.2 3B(19k)并列对比模型集中最低。Ling 3.0 Tiny 每个任务消耗 56k,大约是它的三倍,仅多得一分。
额外模型细节:
➤ 参数:2.6B(稠密)
➤ 上下文窗口:131k token
➤ 输入模态:仅文本
➤ 协议:Apache 2.0
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖