@gosrum 实测通义千问 搭配 Claude Code 的运行表现
分享Qwen3.8-27B + Claude Code 的 ts-bench 测试结果。先直接说结论:llama.cpp 很可能还没有完成优化,推荐使用 vllm + NVFP4 来部署。
目前还难以判断它是否比 Qwen3.6-27B 更适合作为编码代理,后续会继续验证。
【笔记】
●与 Qwen3.6-27B 的对比
・工具调用的错误率大幅降低
・总 token 数变多的原因在后文说明
●think开启(medium)与 no_think 的对比
→说实话,这个结果相当难解读
・至少在 llama.cpp + UD-Q4_K_XL 配置下,使用 no_think 会触发无限循环,完全无法使用。能拿到满分是 auto-compact 的功劳
→推测 llama.cpp 或是模型的聊天模板还有优化空间
・另一方面,vllm + NVFP4 在 medium 设置下没有拿到满分,但在 no_think 设置下拿到了满分
●vllm + NVFP4 与 llama.cpp + UD-Q4_K_XL 的对比
・vllm + NVFP4 完成任务的时间明显更短
→原因之一可能是 llama.cpp 没有命中缓存。vllm 应该是命中了缓存,但也有可能把命中缓存之前的时间也统计进去了
【注意事项】
所有测试的总 token 数都相当高,因此推测这是 Claude Code 版本更新后,缓存命中开始失败导致的。
未来希望能在其他测试框架中也进行验证。
本文由 AI 翻译自英文原帖,技术名词保留英文。
查看 X 原帖