通义千问Qwen 3.8 27B可在16GB显存显卡本地运行
我只是分享一下我的Qwen 3.8 27b配置,它能装进5060TI,酷的是你甚至还能获得视觉功能!以及85K上下文(我还有1.5GB余量,可以增加更多上下文或使用更好的量化版本)
模型:来自https://huggingface.co/ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF的IQ3_XXS-mtp
使用beellama https://github.com/Anbeeld/beellama.cpp
使用的配置:
[*]
model = ..\llm-models\Qwen3.8-27B-GSQ-RCO-IQ3_XXS-mtp.gguf
mmproj = ..\llm-models\mmproj-Qwen3.8-27B-BF16.gguf
image-min-tokens = 256
gpu-layers = 99
ctx-size = 85000
no-host = true
direct-io = true
threads = 8
batch-size = 2048
ubatch-size = 512
fit = off
ctx-checkpoints = 0
spec-type = draft-mtp
spec-draft-n-max = 2
cache-type-k = kvarn4
cache-type-v = kvarn4
kv-tail-tokens = 256
我成功在解码时达到45tks,预填充时约300
是的,它使用了kvarn4,但没那么糟糕,看看:
https://anbeeld.com/articles/kvarn-kv-cache-implementation-and-benchmarks
我也知道你可以把mmproj移到CPU上以释放更多显存。
很想听听其他配置,为16GB显存显卡找到最佳方案!
―― 高票评论(帖子共22条讨论)――
[+5] u/NihmarRevhet:如果你把mmproj卸载到RAM,也许增加b/ub,你应该能获得更多预填充。我加载80k+ token时得到300。
[+2] u/inexorable_stratagem:300的预填充似乎太低了。我有2块5060ti,预填充能达到1300。
也许你应该调整一些配置
[+2] u/Sitkin_Marrel:45 tks解码,同时85K上下文和视觉模型保持加载,而整个讨论都在关注预填充。预填充是每个提示的一次性成本,解码才是你整个会话中感受到的,所以我宁愿要这个解码数字,而不是两倍大小的预填充数字。
[+2] u/AbleShower2801:kvarn4 + 视觉Qwen适配16GB才是beellama的卖点,而不是分支名称。85K上下文在5060 Ti上还有余量,这是真正的本地服务胜利。如果你整理本地推理/编码工具,https://github.com/hashgraph-online/awesome-ai-plugins或https://hol.org/plugins接受提交。
[+1] u/_wortkarg_:Qwen3.8-27b UD-Q3_K_XL 5060Ti 16Gb,llama.cpp,无视觉,MTP,96k上下文(使用28k),45-55 t/s生成,400-800 t/s预填充(从800降到400)。
llama-server \`
\-m ./unsloth/Qwen3.8-27B-GGUF/Qwen3.8-27B-UD-Q3_K_XL.gguf \`
\--spec-type draft-mtp \`
\--spec-draft-n-max 3 \`
\--device-draft CUDA0 \`
\--n-gpu-layers-draft all \`
\--ctx-size 98304 \`
\--chat-template-kwargs '{\\"enable_thinking\\":true,\\"preserve_thinking\\":true}' \`
\--jinja \`
\--reasoning-format deepseek \`
\--reasoning-preserve \`
\--flash-attn on \`
\--cache-type-k q4_0 \`
\--cache-type-v q4_0 \`
\--fit off \`
\--n-gpu-layers all \`
\--threads 8 \`
\--threads-batch 8 \`
\--batch-size 512 \`
\--ubatch-size 256 \`
\--parallel 1 \`
\--temp 1.0 \`
\--top-p 0.8 \`
\--top-k 20 \`
\--min-p 0.0 \`
\--presence-penalty 0.0 \`
\--repeat-penalty 1.0