AI Pulse

双3090跑满27B量化模型全上下文,解码超70 tok/s

这套配置的性能表现

作者最初并未意识到自己的配置有多好,直到看到其他人在相同硬件上以不到一半的速度和一半的上下文挣扎。他在数十种量化方案、vLLM/sglang/llama.cpp 及各种配置上做了基准测试,最终得到以下结果:

- 完整 262k 上下文(KV cache 几乎可同时容纳 2 个完整上下文)
- 单流解码 >70 tok/s
- 3~4 并发下接近 200 tok/s(即饱和点)
- prefill 速度 >10k tok/s(当 KV cache 负载较小时)

这些数字来自原版 vLLM v0.29(Linux),模型是 RedHatAI/Qwen3.8-27B-INT4。

步骤 1:选择合适的量化模型

关键选择是 RedHatAI/Qwen3.8-27B-INT4。作者发现很多人忽视了 RedHat 的这个量化版本,但它对 Ampere 架构来说近乎理想:INT4 权重 + FP8 KV cache,外部基准显示性能与 BF16 权重几乎相同。这种加权 KV cache 在同类量化模型中很少见,能显著降低显存占用,从而在双 3090 上跑满 262k 上下文。

步骤 2:使用原版 vLLM 启动服务

在 Linux 上用原版(stock)vLLM v0.29 执行以下命令:

vllm serve RedHatAI/Qwen3.8-27B-INT4 --max-model-len auto --enable-auto-tool-choice --tool-call-parser qwen3_xml --reasoning-parser qwen3 --enable-prefix-caching --kv-cache-dtype fp8 --trust-remote-code --max-num-seqs 8 --gpu_memory_utilization 0.9 --max-num-batched-tokens 8192 --mm-encoder-tp-mode data   --speculative-config '{"method":"mtp","num_speculative_tokens":3}' --tensor-parallel-size 2

这些参数是 Qwen3.8-27B 在 vLLM 中的标准配置,作者认为它并不特殊。其中几个关键项:

- --kv-cache-dtype fp8:KV cache 使用 FP8,进一步节省显存;
- --speculative-config '{"method":"mtp","num_speculative_tokens":3}':启用 MTP(Multi-Token Prediction)推测解码,提升解码速度;
- --tensor-parallel-size 2:双卡张量并行。

步骤 3:验证性能与监控

作者通过 vLLM 的 metrics API 搭配 Prometheus + Perses 对真实工作负载监控了一个月,并用 vllm bench serve 在调参期间测量性能。这些数字来自实际运行中的统计,而不是单次 benchmark 的峰值。

步骤 4:参考硬件配置

作者也在租用的不同硬件上复现了相似结果。以下是他当前租用的两个配置示例,可以看出对 CPU、内存和 PCIe 的要求并不苛刻:

配置一:
- CPU: AMD EPYC 7532 32-Core Processor(有效核心 64)
- 内存: 64.3 GB
- 磁盘: KINGSTON SNV3S4000G,带宽 1918.0 MB/s
- 主板: MZ32-AR0-00
- PCIe 带宽: 12.8 GB/s,PCIe 4.0/8x

配置二:
- CPU: AMD Ryzen Threadripper PRO 3945WX 12-Cores(有效核心 24)
- 内存: 128.8 GB
- 磁盘: CT2000P510SSD5,带宽 6536.0 MB/s
- 主板: MC62-G40-00
- PCIe 带宽: 12.7 GB/s,PCIe 3.0/16x

社区补充:其他用户的替代方案与考量

原帖评论中有不少有价值的反馈:

- 有用户指出,本版块里一半的性能抱怨都是配置问题;原版 vLLM + 合适的量化方案就能达到 70 tok/s。
- 也有用户对 INT4 的质量有顾虑,宁可选择更高量化版本的 Swift 模型,接受更长的等待时间以换取更可靠输出。
- 一位使用 2xA5000 的用户推荐 incoai/Qwen3.8-27B-DFlash2(替代 MTP),在接近满上下文时单流 70 t/s,空上下文时可接近 100 t/s,但 prefill 明显更慢;他认为输出质量至少不逊于 UD q4_k_m。
- 还有用户声称在双 3090 上能用原版 vLLM 达到 100+ decode,5 并发时 200+。
- 有评论对“FP8 KV + INT4 权重”的组合表示惊讶。

这些第三方数字因环境不同可能有所差异,但都说明这套硬件和模型组合的性能潜力很大。

阅读原文
📚 相关主题 大模型部署开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新