AI Pulse

RTX 3090本地跑270亿参数大模型 长对话回复仅1秒

一位开发者为 Qwen3.8-27B 发布了一轮新的本地推理优化,测试硬件是 RTX 3090。单用户推理约 138 tokens/秒;长对话里一次后续回复,从约 23 秒降到约 1 秒。这位开发者上回说那可能是最后一次更新。结果后来出现了更好的草稿模型,又排查出两个默认关闭的功能,于是又发了一版。

这次更新第一项是 DFlash2,一个由 Inco 发布、专门适配这个模型的块状草稿模型。它只有 5 层,一次非自回归预测 7 个 token,还带一个路径选择器。开发者把它重新量化为 GPTQ int4,大小从 3.85 GB 降到 1.19 GB。贪婪解码下接受率没有损失。

DFlash2 的适用边界很明确。它最适合 1-4 个并发用户。每个请求要预留 8 个循环状态槽,8 个以上并发时 MTP 方案反而更优。它的上下文窗口只有 2,048 token,所以在长上下文自由形式散文上,MTP 仍然略占优势。

第二项是查找增强草稿:扫描请求自身的 token 历史来提出后续 token。在“复现每个命令”这类任务上,每步生成的 token 数增加 29%,速度从 105 升到 131 tokens/秒。普通聊天只提升约 5%,每步额外开销 0.075 毫秒。

开发者还为混合模型启用了前缀缓存。一篇 24k token 的长文档,第二次起的提问从 23 秒降到 0.85-1.35 秒,答案逐 token 相同。批处理场景收益更明显。64 个请求共享一个 5,820 token 的系统提示,处理时间从 222 秒降到 16.9 秒。整体吞吐 942 tokens/秒,中位延迟从 95 秒降到 8 秒。另外还修复了 vLLM 里混合模型 KV 缓存组大小分配的一个错误。每个 token 的缓存内存从 105 KB 降到 78 KB。

质量没变:困惑度 8.09,GSM8K 96.5%。

部署方面,Docker 镜像固定 vLLM 0.27.1 并带全部补丁,docker compose 一条命令就能启动。构建时会跑 verify.sh,prepare 步骤负责下载并重新量化模型。代码仓库和模型权重都公开了。

有评论者问 RTX 3060 能不能用,目前还没有明确答案。补丁现在以固定版本加补丁的镜像形式分发,会不会合入 vLLM 主线也还没消息。

阅读原文
📚 相关主题 大语言模型AI推理优化开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新