AI Pulse
📡 X 信号

@gosrum 实测通义千问 搭配 Claude Code 的运行表现

@gosrum 实测通义千问 搭配 Claude Code 的运行表现

分享Qwen3.8-27B + Claude Code 的 ts-bench 测试结果。先直接说结论:llama.cpp 很可能还没有完成优化,推荐使用 vllm + NVFP4 来部署。

目前还难以判断它是否比 Qwen3.6-27B 更适合作为编码代理,后续会继续验证。

【笔记】
●与 Qwen3.6-27B 的对比
・工具调用的错误率大幅降低
・总 token 数变多的原因在后文说明

●think开启(medium)与 no_think 的对比
→说实话,这个结果相当难解读

・至少在 llama.cpp + UD-Q4_K_XL 配置下,使用 no_think 会触发无限循环,完全无法使用。能拿到满分是 auto-compact 的功劳
→推测 llama.cpp 或是模型的聊天模板还有优化空间

・另一方面,vllm + NVFP4 在 medium 设置下没有拿到满分,但在 no_think 设置下拿到了满分

●vllm + NVFP4 与 llama.cpp + UD-Q4_K_XL 的对比
・vllm + NVFP4 完成任务的时间明显更短
→原因之一可能是 llama.cpp 没有命中缓存。vllm 应该是命中了缓存,但也有可能把命中缓存之前的时间也统计进去了

【注意事项】
所有测试的总 token 数都相当高,因此推测这是 Claude Code 版本更新后,缓存命中开始失败导致的。

未来希望能在其他测试框架中也进行验证。

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新