本地模型训练不足却效率第一,中等推理档位就够
Qwen3.8-Flash-Next NVFP4 是一个本地模型。它在 agentic coding 基准测试里拿到接近最高的分数。
它同时也是效率最好的一个。每个得分点所需的请求次数和生成的 token 数都最少,速度也很快。测试者补了一句:这一切来自一个训练不足的模型(undertrained)。也就是说,还没被充分优化,它已经能排到前面。
推理档位:medium 就够,xhigh 白费
推理档位的选择直接影响成绩。测试者说,所有高分都来自 medium(中等)推理设置。xhigh(超高)在这个基准里没有用处。
评论区有人补了一句:medium 和 xhigh 解决的是完全相同的任务。不只是分数一样,任务也一样。换句话说,调高推理档位不会让模型去思考更难的问题。它只是换一种跑法,结果一样。
有开发者反馈,medium 是唯一真正能用的档位,对复杂任务来说值得。另一位开发者用 Hermes agent。交互式会话里用低到中等推理,把 xhigh 推理委托给子代理。他的体会是,这样出来的代码质量更好,调试工作量也更少。
把这些放一起,结论落在选档位上:medium 已经能跑出头部成绩。最高档位反而派不上用场。
内存占用:160GB 起步
不过,选对档位不等于随便找台机器就能跑。一位测试者的配置是单张 RTX PRO 6000 96GB 显卡,加 192GB DDR5 内存。模型加载进 vLLM 时,约 160GB 内存被占用,系统只剩 4GB。96GB 显存没成为门槛,系统内存先不够了。
另一位开发者在等 vLLM 支持把 ngram 卸载到 NVMe。他的目标配置是单张 RTX 6000 Pro 显卡加 32GB 内存的迷你主机。在功能落地前,他继续用 Qwen3.8 27B。
版本有讲究,也有怪现象
分数能不能复现,先看你下载的是哪个版本。测试里有一个得分明显偏低的版本,来自 Hugging Face 上一个标注“未审查”的仓库。测试者叫它“随机”版本,和表现好的那个差距很大。
还出现了一个让测试者觉得奇怪的现象:Q2 量化版本的表现反而优于 Q8 版本。模型目前不支持 llama.cpp 及其多种量化版本。依赖 llama.cpp 的人暂时用不上它。
单个任务击败过 DeepSeek,也有人选择不换
单个任务上的对比数据也有。有测试者提到,模型在某个 live bench 任务上击败了 DeepSeek。它用的 token 更少,速度也更快。另一位测试者说有视觉能力,但没法让它工作。
这只是一项任务的表现,不能推出全面超越。一位评论者说,它相比 Qwen3.8 27B dense 是一个巨大的升级。但也有人反馈:dsv4f 0731 full model 仍然表现强劲。他打算继续用下去。新模型没有让所有人都立刻换掉手上的版本。
测试者计划继续测其他版本。评论区有人请求测 Tiel-Coder-35B-A3B。他说自己正在用,体验很好。还有人希望尽快加入 GLM 5.3 flash 的基准测试。基准测试仓库的维护者也出现在评论区,确认那是他的项目。