普通游戏电脑跑177B大模型,12GB显存速度够日常用
一台游戏电脑的数字
一位开发者在 Windows 上发布了基准测试。他用 RTX 5070 12GB 显卡,配 32GB DDR4 内存,跑 Qwen3.8-Flash-Next 177B。基准速度约 11.5 tok/s,正常对话能到 14-15 tok/s。生成 10,000 个 token 大约需要 16 分钟,平均 10.41 tok/s。
整套配置包括 RTX 5070 12GB、DDR4-2400 内存、Ryzen 5 5600GT CPU、PCIe Gen3 总线和 Windows 系统。都是消费级硬件,一台普通游戏电脑就能凑齐,不用上工作站。
速度从哪来
177B 参数的模型,权重装不进 12GB 显存。作者用 llama.cpp 搭了一套专家流式加载方案,跑 UD-IQ3_XXS 量化版本。GPU 按需拉取专家层权重,不用把整个模型一次装进显存。
关键优化有三处:修复 Windows 的 I/O 队列深度问题,每个 worker 改用单个文件句柄,用页锁定内存建立热专家层。目的都是让 GPU 更高效地拉取高频使用的专家权重。基准速度从约 7 tok/s 提到 11.5 tok/s,提升约 64%。
一次长编码提示词生成了 4,892 个 token,速度 10.15 tok/s。产出一个能直接运行的贪吃蛇游戏单文件。日常聊天这个速度够用,长代码任务也能直接出成品。整个运行都在本地,提示词和代码不需要上传云端。
还能更快吗
评论区在讨论上限。有评论者建议换用 Strata 引擎,称速度可以快 4 倍。有人附和,说试过会感到惊喜。有评论者觉得这个速度不错,打算在自己电脑上试。还有人说,再加点内存,速度能快 2-3 倍。这些说法都没有附带测试数据。
有人在意的点是长对话质量:角色扮演场景跑几千个 token 后,会不会出现上下文漂移(对话跑偏)。目前没有测试结论。
作者把失败过的尝试、基准脚本和方法论全部放上了 GitHub,邀请社区提供流式优化建议。输出质量对照控制模型做过验证。发布的基准数据基于一组从独立提示集构建的热文件。热文件如何影响结果,作者没有展开说明。
同一套硬件,纯软件优化就把速度拉高了六成多。Strata 引擎和加内存的提速倍数如果被验证,本地跑大模型的成本还会更低。