AI Pulse

双3090跑27B大模型,每秒出150个汉字

双 RTX 3090 跑 Qwen3.8-27B,单请求解码 218 token/s。按汉字折算,每秒大约出 150 个字。本地推理跑到这个速度,对话基本实时,长文生成也不会一个字一个字慢慢出。

数字来自 Club-3090 基准套件。测量流程统一:3 次预热加 5 次正式测量,温度 0.6、top_p 0.95、top_k 20。同一套标准下,Code 模式解码 218.3 token/s。Narrative 模式是 120.1 token/s。把全部开销算进去,Wall TPS 分别是 204.8 和 117.7。第一次响应只要 168 到 178 毫秒。

速度从哪里来

三个组件叠出这个成绩。主模型 Qwen3.8-27B,AutoRound INT4 量化,group 128。推理引擎是 vLLM v0.26.1rc1。加速核心是 DFlash2 草稿模型。

简单说,推测解码是让一个更小的草稿模型先生成候选 token,主模型只负责验证。命中率决定收益大小。DFlash2 一次生成 7 个候选,平均接受长度 3.35,接受率 47.8%。接近一半的预测被主模型直接采纳,省掉不少重复计算。

上下文预填充速度,10k 时 1342 token/s,90k 时降为 628 token/s。长上下文的起步代价,数字上看得清楚。

显存与上下文上限

资源占用不低:峰值显存每卡 22.3 GB,DFlash2 草稿模型单独吃掉约 13.5 GB。两张 24 GB 显存的 3090,每张余量不到 2 GB。上下文上限 131k,处理长文档足够,显存也差不多用尽了。

软件不是开箱即用

作者对 vLLM 做了自定义修改,整套方案才能干净启动。改动挂在 GitHub 的 Pull Request 里。所有 vLLM 修复都是另一个 AI 模型 Kimi K3 干的——用 AI 来修 AI 的推理引擎。

社区反应

评论区里,有人调侃:“冷静点,头儿,Dario 要心脏病发作了。” Dario 大概率是 Anthropic 的 CEO。有人预测 RTX 3090 的价格会被推高。另一个说自己硬件配置完全相同,第二天就准备复现。还有评论直接问具体模型和量化方式。

一位评论者说,Club3090 正在找最优化实现,自己用着 Qwen3.8 现有方案。他忍不住想试试 d-flash 2。也有人认为,DFlash2 的 vLLM 实现大概比 llama.cpp 版本更优化。

硬件门槛:PCIe 通道

跑出 218 token/s 的平台,两张卡各自占满 PCIe Gen4 x16,没有 NVLink。打了 P2P 补丁,让两张卡直接通信。功耗限制在 220/250 W。

评论里也有反面案例:AMD B550 主板、64GB DDR4,第二张卡只分到 x1 通道。速度只有约 20 token/s。同样两张 3090,x16 和 x1 的通道分配,速度差出十倍。

阅读原文
📚 相关主题 大语言模型本地部署

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新