他用RTX 5080实测21个Qwen3.8量化版:最佳与最差相差16倍
在 Qwen3.8 27B 发布后,我决定在我自己的代码(C 代码)上对能塞进我 GPU(RTX 5080)的模型进行基准测试。结果并非完全出乎意料,但某些量化版本确实令人失望。
太长不看:综合最佳:bartowski/Qwen3.8-27B-IQ4_XS。最佳无审查版:huihui-ai/Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS。如果想要更多上下文:jpetrina/Qwen3.8-27B-IQ4_XS-pure,无审查版:Bucoid/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW
(按平均KLD排序)
| 模型 | 平均KLD | 相同top p | GGUF大小 |
|---|---|---|---|
| sdkyuan/qwen38-27b-qat-q2_0 | 0.893177 ± 0.006948 | 85.727 ± 0.110 % | 8.2GiB |
| ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ2_XS.gguf | 0.767174 ± 0.006291 | 86.166 ± 0.108 % | 7.8GiB |
| ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ2_S | 0.512614 ± 0.004909 | 88.802 ± 0.099 % | 8.6GiB |
| empero-ai/Qwen3.8-27B-Ridge-3.7bpw | 0.475767 ± 0.004483 | 89.612 ± 0.096 % | 11.7GiB |
| ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-IQ3_XXS | 0.379222 ± 0.003992 | 90.270 ± 0.093 % | 9.4GiB |
| unsloth/Qwen3.8-27B-UD-Q2_K_XL (UD2) | 0.350861 ± 0.003745 | 90.626 ± 0.091 % | 9.9GiB |
| unsloth/Qwen3.8-27B-UD-IQ3_XXS (UD2) | 0.268594 ± 0.002971 | 91.951 ± 0.085 % | 11.1GiB |
| DavidAU/Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-NEO-MTP-IQ3_M | 0.251270 ± 0.002702 | 92.315 ± 0.083 % | 13.5GiB |
| esatapedico/Qwen3.8-27B-NVFP4-MTP-LOW | 0.220796 ± 0.002631 | 92.339 ± 0.083 % | 14.5GiB |
| mudler/Qwen3.8-27B-APEX-I-Mini | 0.190209 ± 0.002354 | 93.012 ± 0.080 % | 13.0GiB |
| jrell/Qwen3.8-27B-i1-IQ4_XS-GGUF-Smaller | 0.194459 ± 0.002242 | 93.049 ± 0.080 % | 12.6GiB |
| orcarouter/Qwen3.8-27B-Uncensored-Q3_K_L | 0.192312 ± 0.002294 | 92.726 ± 0.081 % | 13.6GiB |
| unsloth/Qwen3.8-27B-UD-Q3_K_XL (UD2) | 0.147186 ± 0.001809 | 93.734 ± 0.076 % | 12.5GiB |
| unsloth/Qwen3.8-27B-UD-Q3_K_XL (UD3) | 0.142647 ± 0.001860 | 93.789 ± 0.076 % | 12.2GiB |
| Bucoid/Qwen3.8-27B-Uncensored-IQ4_XS_4BPW | 0.091447 ± 0.001261 | 94.774 ± 0.070 % | 13.0GiB |
| huihui-ai/Huihui-Qwen3.8-27B-abliterated-UD-IQ4_XS | 0.082871 ± 0.001205 | 94.981 ± 0.068 % | 13.4GiB |
| unsloth/Qwen3.8-27B-UD-IQ4_XS (UD3) | 0.075626 ± 0.001097 | 95.258 ± 0.067 % | 13.3GiB |
| jpetrina/Qwen3.8-27B-IQ4_XS-pure | 0.061984 ± 0.000917 | 95.551 ± 0.065 % | 13.5GiB |
| bartowski/Qwen3.8-27B-IQ4_XS | 0.056482 ± 0.000856 | 95.835 ± 0.063 % | 14.5GiB |
| unsloth/Qwen3.8-27B-UD-Q4_K_XL (UD3) (装不下) | 0.029844 ± 0.000476 | 96.921 ± 0.054 % | 16.4GiB |
| unsloth/Qwen3.8-27B-UD-Q4_K_XL (UD2) (装不下) | 0.028026 ± 0.000432 | 96.988 ± 0.054 % | 16.7GiB |
希望这能帮助到其他像我一样显存不够的人 :)
―― 高票评论(帖子共 69 条讨论)――
[+75] u/dannone9:只是评论来支持一下研究,我们这些显存贫民很感激你的工作。(如果能知道 KV 量化、能塞进多少上下文,以及每个模型采样了多少提示或 token 作为样本就好了。)
[+32] u/Tall_Abrocoma_3533:这里有个快速可视化,感谢你的工作!
[+17] u/Danmoreng:我觉得 Unsloth IQ3_XXS 是甜点位,因为如果你卸载视觉部分,它可以装下 98k Q8 上下文。IQ4_XS 真的没给上下文留多少空间,而且 KV Q4 是个坏主意。
[+8] u/Dangerous-Nerve-7766:疯狂截图保存 😩
[+4] u/jacek2023:干得好。考虑加个图。你可以用任意 LLM 加 matplotlib 生成。
[+3] u/suprjami:试试 tabbyAPI,用这个量化你应该还能再挤出一点:
https://huggingface.co/turboderp/Qwen3.8-27B-exl3
[+5] u/2Norn:至今我仍后悔去年没买 5090。我当初的选择完全是基于游戏,从没想过自己会搞本地 LLM。
[+3] u/Additional-Ordinary2:谢谢老哥
[+3] u/JLeonsarmiento:是的,HuiHui 做的是最好的 abliterated 版本。
[+3] u/Specialist_Prune_210:我也是 5080,显存这么小真的很难受。
[+3] u/fgk55555:9070 XT 用户在此。顺便说一句,我发现文件大小是最重要的指标。ISTA 的量化在我试过的同尺寸量化里可能最能打,而且小文件意味着更高的 tps 和上下文余地(如果压一压能到 180k)。体验相当一线。KLD 稍微好一点却要损失 80% 的上下文窗口,这并不值得。显然,选择适合你使用场景的量化,但别太纠结这些指标,用什么让你的体验不那么难受就对了。
[+2] u/Pablo_the_brave:Unsloth 的量化太多了。快速看一眼 https://github.com/magiccodingman/MagicQuant-Wiki?ref=genaisecretsauce.com ,你就会知道哪些量化值得测。另外,作为 N 卡用户,你应该看看 ikawrakow 的量化,就是更好。
https://github.com/Thireus/GGUF-Tool-Suite
https://huggingface.co/cHunter789/Qwen3.8-27B-i1-IQ4_KS_KT-GGUF