一位3×3090用户:3bit量化像Q8一样好
我一直反对低量化。我发誓,我能感觉到差别。我也反对量化KV缓存。我在那里吃过亏——我觉得权衡会累积,尤其是在更长的上下文中。
因此,我一直在两张3090上用张量并行运行Qwen 3.8 27B(UD-Q8_K_L)。我对它深信不疑。它真是个了不起的小模型,我可以在完整FP16 KV缓存下获得接近最大的上下文,感觉棒极了,而且是一个令人惊叹的编程智能体。我用它构建了整整几个项目。与3.6版本不同,3.8我可以跑到25万+上下文而丝毫没有退化感。用3.6时,我只有在约15万以内才感到舒适,之后就会考虑压缩或开启新会话。
然而,我有一块闲置的第三张3090。我一直在用它来实验LoRA,以及运行Datadog的Toto等其他GPU可用的模型。有时我也用它加载更大的模型,但在速度和量化上的权衡很少值得。
直到现在。
我加载了Qwen 3.8 Flash Next的UD-Q4_K_XL版本,说实话——它跑得比我期望的慢得多。并非所有模型层都放进VRAM,有些卸载到了RAM。我确信我的系统有某些地方没有调好,但我的输出速度最高约50t/s,平均大概38,而PP(预填充)糟透了——只有几百。在享受过75-100t/s+的输出和1000t/s的PP之后,这是我无法忍受的。
但当我看到输出时。天哪。
我有一个最愚蠢的基准测试,是每个新模型我都会首先运行的。我让它给我做一个Flappy Bird。我用一个基本的提示词——没什么特别。只在一个聊天会话里,没有工具。我知道这听起来很荒谬,但因为我已经跑过这个提示词几百次,我可以通过它生成的内容读出关于模型的很多信息。所有的小细节、玩法手感、是否包含声音、图形“特效”、滚动背景等等。而且因为始终是同一个测试,我还能感受到模型的运行速度。
我从未见过像这样的Flappy Bird。它有一个围绕游戏窗口构建的完整UI——我以前做的每个FB都只有游戏在中间。它有最酷的动画。它有多种机制:
- 如果你靠近管道而没有撞上,会获得“奖励分”(在好模型上以前见过)
- 管道开始上下移动 <---- 完全独特,且做得非常好
你可能会对自己说:“哦,那只是在训练数据里。”而我会回答你——我知道!而且它棒极了。如果每个模型的训练数据里都有这个,那么你会期待它们都差不多。很多确实是,但这个很特别。显然,在世界知识方面,它比3.8 27B模型要多得多。
总之——这些都很好,但我无法使用一个PP低于250t/s、长上下文输出35t/s或更慢的模型。唉。
但我也在摆弄EXL3量化(顺便说一句,对于2x3090上的27B来说不值得,llama.cpp一样好甚至更好),所以我注意到,我可以让3.05bpw的Qwen 3.8 Next Flash模型完全运行在VRAM中,保持完整上下文和FP16 KV缓存,只有engram表卸载到RAM。于是我试了一下。
我现在就告诉你——如果你给我这个模型,问我这是什么量化,我会100%说这是Q8量化。这是我用过的最连贯、最有能力、最博学、最会调用工具的3-bit模型。除了在VRAM上跑得快得多,它与Q4_K_XL版本毫无差别。也许Unsloth的Q3量化也一样好——试试看,然后告诉我。
它能切能剁。它运行速度110+ t/s,PP超过1500 t/s。
如果你觉得这些数字在3x3090上算差,那可能确实差。我把所有卡都跑在250-265W,其中一张通过TB4 eGPU连接。并不理想,但我仍然得到了这些数字。就这个质量来说简直是疯狂。
TL;DR:我唠叨了大概8段。如果你有3x3090,就用Exllama3(exl3)上的Qwen 3.8 Next Flash,3.05 bpw。
—— 高票评论(帖子共24条讨论)——
[+11] u/Strange_Bus5917:我没有3090,但我很喜欢这个帖子。一个量化模型能跑这么好,听起来真了不起。
[+2] u/brickout:太对了。我们这种人真的有几十个。
[+2] u/PassengerPigeon343:我被说服得足够想去试试。你是说Q3的3.8 Flash Next比Q8的3.8 27B更好?我试过Q4_K_XL,也发现了同样的问题,以那样的PP/TG速度没法日常使用。但如果我能接近那个速度,我会很兴奋。
[+2] u/Tagedieb:这就是我不理解那些反对低量化的人的地方。一次又一次地证明,更多参数配合更低量化能给你更多。当然这在极低端不适用。归根结底,总是在质量、数量和token速度之间找到正确的权衡。
[+2] u/esw123:Qwen3.8 Flash Next Q4是第一个我能信任的模型,每10个任务只需复查1次以确保一切仍然正确。试着把它和qwen3.8 27B Q5一起用于快速修复,平均来说几乎每次都能有不错的表现。
[+2] u/Sitkin_Marrel:Flappy Bird基准测试依然不败。一个3.05bpw的模型,管道还能移动,不应该这么连贯。
[+1] u/DeepFeeling1:这个模型在这个fp下有基准测试吗?
[+1] u/Blues520:我想试试。能分享你的tabby配置吗?
[+1] u/egnegn1:请提供你的完整命令。
[+1] u/a_beautiful_rhind:我一打开这个帖子,就知道又有人要推荐qwen了。
[+1] u/dowjames:你的提示词是什么?
[+1] u/jikilan_:能分享你的qwen3.8 27b llama.cpp参数吗?对你的TP2和接近全上下文数字很好奇。