Qwen 3.8 27B 基准:medium 模式才是智能体编程首选
Qwen 3.8 27B 在 medium 推理模式下,得分高于 3.6 版本,同时效率高得多(所需请求几乎减半,生成的 token 减少三分之一),达到了 DeepSeek v4 Flash 3107 MXFP4 的水平。
xhigh 模式号称最适合困难任务。但在本次基准测试中,优势并不明显。得分与 medium 版本相当,却需要更多请求(仍略少于 3.6),生成的 token 几乎是 medium 模式的四倍……
注意:奇怪的是,正确配置为 medium 模式的 NINFER 版本,行为却像 xhigh……不排除用户操作失误,但我反复检查了三遍。
对我来说,智能体编程的真正收益在 medium 模式。
(xhigh 可能更适合单提示词任务——就像每个模型发布时到处都在测的那样。)
更多数据和图表,请查看公开页面:https://wonderrico.github.io/local_llm_benchmark/benchmark-main.html?filter=27b
更多细节请见:https://wonderrico.github.io/local_llm_benchmark/benchmark-detail.html?filter=27b
高票评论(原帖共 8 条讨论)
[+5] u/hiImMate:单次测试中 xhigh 肯定很重要,但这次基准非常有意思。看起来日常使用 medium 完全够用,而且节省大量时间。
[+2] u/_-_David:我觉得你的思路是对的。Xhigh 适合一次性演示,但 medium 在智能体框架中表现相近,我并不意外。
[+1] u/Green-Ad-3964:Qwen3.8-27B-NVFP4-medium 看起来很有意思。
[+1] u/Brazen-Badger:原来如此!难怪 ninfer 用起来感觉很慢,尽管 t/s 很高。它连最简单的请求都要想太多。希望他们修复。
[+1] u/TheCat001:网站和图表非常酷。感谢你的工作。
终于有确认了!我用屁股都感觉到 Ornith 比其他所有 35b Qwen 更聪明……