AI Pulse

本地模型多项基准反超Opus 4.8,内存才是真门槛

最近一张对比表,把五款能下载到本地的模型和云端的 Opus 4.8 放在一起。表是 GLM-5.3 照着各模型的官方 Hugging Face 页面整理的。发布者写明,Opus 的成绩只作参考,不参与每行的最佳排名。

五个本地模型的规模差得很远:

- DeepSeek-V4-Flash-Vision-Exp:总参数约 285B,激活参数 13B
- DeepSeek-V4-Flash-0731:总参数 284B,激活参数 13B
- Qwen3.8-Flash-Next:总参数 125B,激活参数 6B
- GLM-5.3-Flash:总参数 320B,激活参数 18B
- Qwen3.8-27B:总参数 27B,激活参数 27B,没有混合专家结构

Opus 4.8 的参数规模没有公布。

简单说,总参数是模型文件的完整规模,激活参数是每次推理真正用到的那部分。前四个模型走的是混合专家路线:总参数很大,每次只激活一小块,运行时的内存压力因此小很多。Qwen3.8-27B 没做这一步,全部参数一起上阵。

编程、智能体、多模态

编程和终端操作的几行,本地最高分没有归到一家头上。Terminal Bench 2.1,DeepSeek-V4-Flash-Vision-Exp 拿 83.9,Opus 是 85.0。NL2Repo 上同样是它拿 57.7,Opus 是 69.7。SWE-bench Pro 和 SWE-bench Multilingual 归 Qwen3.8-Flash-Next:Pro 上 62.5 对 69.2,Multilingual 上 81.0 对 84.4。DeepSWE 一行,GLM-5.3-Flash 以 61.1 超过 Opus 的 58.0。

智能体测试看的是工具调用和自动化操作。Toolathlon-Verified 上 DeepSeek 75.9,Opus 76.2。CoWorkBench 和 JobBench,Qwen3.8-Flash-Next 拿 73.9 和 55.7,那两行没有 Opus 成绩。Agents“ Last Exam 上 GLM 拿 28.1,Opus 只有 25.7。

知识推理这边,GPQA Diamond 上 Qwen 拿 91.7,Opus 93.6。HLE 分两种测法。不带工具,Qwen 35.9,Opus 49.8,云端领先明显。带上工具,GLM 22.9,Opus 25.4,差距缩到 2.5 分。

视觉类的结果里能看到反超。Chartography 上 DeepSeek 视觉版 64.3,Opus 65.0。ZeroBench 的 Pass@5,DeepSeek 视觉版 35.0,Opus 34.0。BabyVision 差距更大:Qwen3.8-27B 拿 65.7/85.6,GLM-5.3-Flash 是 73.0。Opus 只有 34.1,本地模型翻了一倍以上。

分数之外是内存

把这些数字当成竞赛排名看,会误读这张表。评论区有人指出,表里缺失的结果太多,很难做像样的比较。还有人追问,编码区为什么没有 Opus 分数,是不是 Opus 没有编码任务。表格发布后补过一轮。Opus 补了四行成绩,全部取自 System Card:SWE-bench Pro、SWE-bench Multilingual、GPQA Diamond、HLE(不带工具)。

真正卡住本地模型的不是分数,是内存。一位跑 192GB 内存机器的用户说,他继续用 DeepSeek-V4-Flash。GLM-5.3-Flash 太大,192GB 放不下。Qwen3.8-Flash-Next 本身很好,但在 SGlang 和 vLLM 里优化不到位,也不支持 QAT 量化。Qwen3.8-27B 是他腾出一张显卡时的后备。

同一台机器上,Qwen3.8-Flash-Next 在 IQ4 量化下能跑 500/18。DeepSeek-V4-Flash 要降到 IQ2,才拿到 200/12。评论区有人追问上下文窗口设了多大、峰值内存用掉多少,这两项参数没有出现在榜单里。

Qwen3.8-Flash-Next 在评论区也被单拎出来说。6B 激活参数在多个基准里拿高分,有用户说它”是个怪物",还等着完全训练版。完全训练版什么时候发布,还没有时间表。

把整张表走一遍。没有哪个模型包揽所有本地最高分,也没有哪个模型在全部任务上都输给 Opus。剩下的取舍,绕不开设备的内存边界和手里的任务。

阅读原文
📚 相关主题 大语言模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新