AI Pulse

他用RTX 5080实测21个Qwen3.8量化版:最佳与最差相差16倍

在 Qwen3.8 27B 发布后,我决定在我自己的代码(C 代码)上对能塞进我 GPU(RTX 5080)的模型进行基准测试。结果并非完全出乎意料,但某些量化版本确实令人失望。

太长不看:综合最佳:bartowski/Qwen3.8-27B-IQ4_XS。最佳无审查版:huihui-ai/Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS。如果想要更多上下文:jpetrina/Qwen3.8-27B-IQ4_XS-pure,无审查版:Bucoid/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW

(按平均KLD排序)

模型平均KLD相同top pGGUF大小
sdkyuan/qwen38-27b-qat-q2_00.893177 ± 0.00694885.727 ± 0.110 %8.2GiB
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ2_XS.gguf0.767174 ± 0.00629186.166 ± 0.108 %7.8GiB
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ2_S0.512614 ± 0.00490988.802 ± 0.099 %8.6GiB
empero-ai/Qwen3.8-27B-Ridge-3.7bpw0.475767 ± 0.00448389.612 ± 0.096 %11.7GiB
ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ3_XXS0.379222 ± 0.00399290.270 ± 0.093 %9.4GiB
unsloth/Qwen3.8-27B-UD-Q2_K_XL (UD2)0.350861 ± 0.00374590.626 ± 0.091 %9.9GiB
unsloth/Qwen3.8-27B-UD-IQ3_XXS (UD2)0.268594 ± 0.00297191.951 ± 0.085 %11.1GiB
DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-NEO-MTP-IQ3_M0.251270 ± 0.00270292.315 ± 0.083 %13.5GiB
esatapedico/Qwen3.8-27B-NVFP4-MTP-LOW0.220796 ± 0.00263192.339 ± 0.083 %14.5GiB
mudler/Qwen3.8-27B-APEX-I-Mini0.190209 ± 0.00235493.012 ± 0.080 %13.0GiB
jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller0.194459 ± 0.00224293.049 ± 0.080 %12.6GiB
orcarouter/Qwen3.8-27B-Uncensored-Q3_K_L0.192312 ± 0.00229492.726 ± 0.081 %13.6GiB
unsloth/Qwen3.8-27B-UD-Q3_K_XL (UD2)0.147186 ± 0.00180993.734 ± 0.076 %12.5GiB
unsloth/Qwen3.8-27B-UD-Q3_K_XL (UD3)0.142647 ± 0.00186093.789 ± 0.076 %12.2GiB
Bucoid/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW0.091447 ± 0.00126194.774 ± 0.070 %13.0GiB
huihui-ai/Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS0.082871 ± 0.00120594.981 ± 0.068 %13.4GiB
unsloth/Qwen3.8-27B-UD-IQ4_XS (UD3)0.075626 ± 0.00109795.258 ± 0.067 %13.3GiB
jpetrina/Qwen3.8-27B-IQ4_XS-pure0.061984 ± 0.00091795.551 ± 0.065 %13.5GiB
bartowski/Qwen3.8-27B-IQ4_XS0.056482 ± 0.00085695.835 ± 0.063 %14.5GiB
unsloth/Qwen3.8-27B-UD-Q4_K_XL (UD3) (装不下)0.029844 ± 0.00047696.921 ± 0.054 %16.4GiB
unsloth/Qwen3.8-27B-UD-Q4_K_XL (UD2) (装不下)0.028026 ± 0.00043296.988 ± 0.054 %16.7GiB

图表:u/Tall_Abrocoma_3533

希望这能帮助到其他像我一样显存不够的人 :)

―― 高票评论(帖子共 69 条讨论)――

[+75] u/dannone9:只是评论来支持一下研究,我们这些显存贫民很感激你的工作。(如果能知道 KV 量化、能塞进多少上下文,以及每个模型采样了多少提示或 token 作为样本就好了。)

[+32] u/Tall_Abrocoma_3533:这里有个快速可视化,感谢你的工作!

https://preview.redd.it/kealh9eb9knh1.png?width=2079&format=png&auto=webp&s=a53240b7741ab11c1eca54d420b5b535890cf49f

[+17] u/Danmoreng:我觉得 Unsloth IQ3_XXS 是甜点位,因为如果你卸载视觉部分,它可以装下 98k Q8 上下文。IQ4_XS 真的没给上下文留多少空间,而且 KV Q4 是个坏主意。

[+8] u/Dangerous-Nerve-7766:疯狂截图保存 😩

[+4] u/jacek2023:干得好。考虑加个图。你可以用任意 LLM 加 matplotlib 生成。

[+3] u/suprjami:试试 tabbyAPI,用这个量化你应该还能再挤出一点:

https://huggingface.co/turboderp/Qwen3.8-27B-exl3

[+5] u/2Norn:至今我仍后悔去年没买 5090。我当初的选择完全是基于游戏,从没想过自己会搞本地 LLM。

[+3] u/Additional-Ordinary2:谢谢老哥

[+3] u/JLeonsarmiento:是的,HuiHui 做的是最好的 abliterated 版本。

[+3] u/Specialist_Prune_210:我也是 5080,显存这么小真的很难受。

[+3] u/fgk55555:9070 XT 用户在此。顺便说一句,我发现文件大小是最重要的指标。ISTA 的量化在我试过的同尺寸量化里可能最能打,而且小文件意味着更高的 tps 和上下文余地(如果压一压能到 180k)。体验相当一线。KLD 稍微好一点却要损失 80% 的上下文窗口,这并不值得。显然,选择适合你使用场景的量化,但别太纠结这些指标,用什么让你的体验不那么难受就对了。

[+2] u/Pablo_the_brave:Unsloth 的量化太多了。快速看一眼 https://github.com/magiccodingman/MagicQuant-Wiki?ref=genaisecretsauce.com ,你就会知道哪些量化值得测。另外,作为 N 卡用户,你应该看看 ikawrakow 的量化,就是更好。

https://github.com/Thireus/GGUF-Tool-Suite

https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF

阅读原文
📚 相关主题 大模型测试

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新