AI Pulse

Qwen 3.8 27B 基准:medium 模式才是智能体编程首选

Qwen 3.8 27B 在 medium 推理模式下,得分高于 3.6 版本,同时效率高得多(所需请求几乎减半,生成的 token 减少三分之一),达到了 DeepSeek v4 Flash 3107 MXFP4 的水平。

xhigh 模式号称最适合困难任务。但在本次基准测试中,优势并不明显。得分与 medium 版本相当,却需要更多请求(仍略少于 3.6),生成的 token 几乎是 medium 模式的四倍……

注意:奇怪的是,正确配置为 medium 模式的 NINFER 版本,行为却像 xhigh……不排除用户操作失误,但我反复检查了三遍。

对我来说,智能体编程的真正收益在 medium 模式。

(xhigh 可能更适合单提示词任务——就像每个模型发布时到处都在测的那样。)

更多数据和图表,请查看公开页面:https://wonderrico.github.io/local_llm_benchmark/benchmark-main.html?filter=27b

更多细节请见:https://wonderrico.github.io/local_llm_benchmark/benchmark-detail.html?filter=27b

高票评论(原帖共 8 条讨论)

[+5] u/hiImMate:单次测试中 xhigh 肯定很重要,但这次基准非常有意思。看起来日常使用 medium 完全够用,而且节省大量时间。

[+2] u/_-_David:我觉得你的思路是对的。Xhigh 适合一次性演示,但 medium 在智能体框架中表现相近,我并不意外。

[+1] u/Green-Ad-3964:Qwen3.8-27B-NVFP4-medium 看起来很有意思。

[+1] u/Brazen-Badger:原来如此!难怪 ninfer 用起来感觉很慢,尽管 t/s 很高。它连最简单的请求都要想太多。希望他们修复。

[+1] u/TheCat001:网站和图表非常酷。感谢你的工作。

终于有确认了!我用屁股都感觉到 Ornith 比其他所有 35b Qwen 更聪明……

阅读原文
📚 相关主题 大语言模型基准测试

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新