大模型排名是当前AI领域最受关注的话题之一,但从知识库中的多个信源来看,并不存在一个放之四海而皆准的榜单。不同榜单的评测维度、数据来源和统计口径差异很大,同一模型在不同榜单上的位置可能截然不同,甚至同一榜单的分数也会随时间漂移。理解排名,首先要理解这些榜单各自在测什么、没测什么。
在综合能力榜单上,几个模型反复出现在头部。有人更新的大模型使用测评页面把GLM-5.2排在第一,并提到MiniMax实际表现也不错,可以直接参考这个结果选模型 [1]。而在开源模型的梯队中,根据最新评测,月之暗面的Kimi K3性能优于智谱的GLM-5.2,GLM-5.2又优于DeepSeek v4,这三款模型均具备国际一流水平 [3]。在覆盖10个能力维度、50个评分细项的8款前沿大模型横评中,GPT-5.6 Sol Ultra以98.4分拿到Round 1第一,Claude Opus 4.6以87.6分拿到Round 2第一,而Kimi-K3以91.1分成为唯一在两轮都进入前三的模型,被视为双轮50项综合参考第一 [4]。
不过排名上的名次差距往往小到不足以支撑选择。一次150次生产级测试显示,前四名差距不到0.09分:第一名只用了26B参数、总体得分0.82,Gemini 2.5 Pro为0.81,GPT-5.5为0.75,Claude Opus 4.8 Fast为0.73,但它的指令遵循测试只拿了0.30,是所有模型里最低的 [8]。同一测试中,最快与最慢模型的首token时间差了16倍,可整体得分差距只有0.10,速度差距远大于能力差距,速度已经不再是能力的代名词 [8]。
更值得警惕的是榜单本身的可靠性。有观点指出,纯文本模型GLM-5.2却在GDPval-AA评测排第三,而真实知识工作往往需要看图表,这项评测没法反映真实需求,说明评测基准可能有问题 [2]。AI Stupid Level创始人把基准测试当作纵向测量问题而非排行榜问题,其历史分析覆盖49个模型的31,352次重复得分观察,日内得分的标准差为2.80分,日间中位数的标准差为8.43分,约为3:1的差异,说明时间变异应该被测量,而不是被当作围绕一个永久排行榜得分的噪声 [10]。在另一项针对13个答案验证系统的测试中,一个只看答案长度和格式的基线得分0.7036,竟然高于十三个系统中的八个 [11]。
正因为通用榜单参考价值有限,垂直领域的细分排名反而更实用。在本地编码大模型排名中,GLM 5.3 Flash位列第一,第二是Qwen 3.8 Flash Next,第三是DeepSeek v4.1 Flash,但作者本人称排名一个月内就会变 [5]。开源小模型方面,OpenBMB发布的MiniCPM5-2B成为4B参数以下开源大模型第一,有评论指出如今2B模型的得分已与gpt oss 120b相同 [12]。韩语AI模型排行榜覆盖OpenRouter上的全部425个模型,按价格、提供商、上下文长度、响应速度和韩语质量排名,结果在敬语和韩国制度知识两个轴上最难看,敬语轴只有8.5%的模型拿到A、51.8%拿到F,制度知识轴9.4%拿到A、54.7%拿到F [19]。在餐食卡路里估算对比中,Muse Spark 1.3达标48%,DeepSeek v4 Flash Vision为40%,Qwen 3.8 Flash为36%,Qwen 3.8 27b仅有16% [20]。
榜单工具和平台本身也在快速演进。MTEB老榜因为模型和基准越来越多,加载越来越慢还经常崩,开发者用FastAPI和Svelte重写后速度快了一个量级,支持按领域、语言、模态甚至单个任务过滤,还会标注模型是否在任务训练集上训练过,以帮你避开刷榜出来的假分数 [7]。B.AI平台内置动态更新的模型排行看板,完全基于全网真实交互与调用数据生成,可切换高使用量与热门趋势两个维度,支持按昨日、近7天、近30天追踪排名变化 [15]。Cuey则支持并排对比多个大模型的回答,因为单一大模型的正确率只有67%,对比不同模型能快速发现分歧,避免答错后付出时间或金钱成本 [16]。OpenRouter排行榜上还出现过谁都没听说过的Hy3 LLM突然大幅领先的情况,该榜单面向所有能调用的公开模型 [6]。
从使用角度看,多模型排名显示ChatGPT、Google Gemini和Claude AI是当前使用率最高的三大模型,反映多模型生态已成现实,用户不再依赖单一技术栈,而是按任务切换工具 [9]。这意味着选模型时更合理的做法是结合自身任务去看对应的细分榜单,同时留意评测口径、样本量和榜单时效,而不是只盯着一个综合名次。