8小时、9模型、同一提示词:RTX 3060上谁最接近前沿智能?
我基本上花了整整 8 个小时用完全相同的网页开发提示词去测试不同模型,终于搞定了。
这次九小时测试的全部意义在于:哪款本地模型能在体积上接近前沿智能水平,同时又能轻松塞进 RTX 3060 这类消费级显卡。
我的环境:
* GPU: RTX 3060 12GB
* 内存: 16GB DDR4 单通道
* 系统: CachyOS (Arch Linux)
* 本地模型全部通过我本地的 llama.cpp 环境运行。
* 每个模型都使用完全相同的提示词。
* 我录了生成过程,这样你可以直接评判网站效果,而不是依赖我的描述。
提示词
>为一个虚构的高端科技工作室 NOVA//LABS 构建一个精美、可投入生产质量的一页式网站。
>
>目标:让它看起来确实是由一位资深人类前端设计师设计,而不是典型的 AI 生成式 SaaS UI。
>
>要求:
>
>* 使用原生 HTML/CSS/JavaScript,或者如果你特别偏好,可以使用 React + Tailwind。
>* 一切必须能本地运行,设置尽可能简单。
>* 由你自己创建完整的项目/文件。
>* 不需要后端、认证、数据库或不必要的复杂度。
>* 响应式桌面端 + 移动端布局。
>* 出色的排版、间距、层级、微妙的动效,以及优秀的视觉构成。
>* 深色、精致的视觉语言,克制地使用渐变/发光。
>* 避免典型的 AI 垃圾风格:不要过度圆角卡片、巨型渐变块、随便的玻璃拟态、无意义的统计数字,或那种千篇一律的“赋能未来”文案。
>* 让文案具体且可信。
>* 包含:
> 1. 一个引人注目的 Hero 区域,配上简洁有力的标题。
> 2. 一个表现抽象计算系统的微妙动画视觉。
> 3. 一个小型精选作品/项目区域。
> 4. 一个简洁的能力区域。
> 5. 一个有力的收尾 CTA/页脚。
>* 加入有品味的交互,例如悬停状态、滚动显现,以及在确实能提升设计效果的地方加入细微的光标/鼠标特效。
>* 优先考虑视觉质量,而不是功能数量。
>* 只有在确实必要时才使用可免费获取的 CDN 资源;否则用 CSS/SVG 来创建视觉元素。
>* 让实现保持合理的小巧与易理解。
>
>最重要的是:自己做强有力的设计决策。不要在开始构建之前解释你的设计选择。先创建项目,最后给出运行它所需的确切命令。
>
>(自包含的 HTML,带 JS 和 CSS)
我想看这些模型实际构建出来的东西,而不仅仅是它们解释代码的能力。
模型
1. Gemini 3.8 Flash
约 3 分 12 秒
使用了 Antigravity,消耗了大约 9K tokens。
这是本次测试的前沿模型参考点之一。
2. GPT-5.6 Sol
约 1 分 6 秒
Token 用量我这边看不到。
和本地模型相比非常快,所以这是另一个有用的前沿参考。
3. Claude Sonnet 5
约 4 分 56 秒
Token 用量不可用。
也作为前沿参考。(由于我的 Claude-Code Max 订阅已过期,我只能用 Sonnet 5)
本地模型
4. Bonsai 2 27B Ternary
约 45 分钟
* 原生 ternary / ~2-bit 模型
* 模型大小:约 7.66GB
* 平均生成速度:约 34–36 tok/s
* 上下文:最高约 102K
* 这次运行在 122K 上下文中使用了约 52K tokens
5. Qwen 3.8 27B GSQ-RCO-IQ3-XXS + MTP
约 57 分钟
* 模型大小:约 10.4GB
* 启用了高思考模式
* 满上下文时约 29 tok/s
* 在很小/接近空的上下文时约 40 tok/s
* 上下文使用量达到约 75K
* 上下文被压缩了两次
* 这次运行在相关设置/限制后可用的上下文约为 49K
对我来说,这可能是最有趣的本地模型结果。
6. Qwen 3.8 27B Q4_K_M Unsloth Dynamic 3
2 小时以上
* 约 16.4GB 模型
* Q4_K_M
* 启用了高思考模式
* 满上下文时生成速度掉到约 4 tok/s
* 上下文达到约 96K
* 在 12GB GPU 上显然需要大量 CPU/RAM 卸载
使用的参数:--jinja --reasoning-preserve -fa on -fit off -ngl 99 --override-tensor "blk\.([0-9]|[1-3][0-9]|4[0-5])\.ffn_.*=CPU" -ctk q4_0 -ctv q4_0 --gpu-layers-draft all --spec-type draft-mtp --spec-draft-n-max 2 -lv 4 --no-mmproj -np 1 --temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --repeat-penalty 1.0 --load-mode none --no-warmup -b 256 -ub 128 -c 98304
7. Qwen 3.8 27B GSQ-RCO-IQ3-XXS + MTP — 关闭思考
约 12 分钟
同一个 Qwen 3.8 GSQ-RCO 模型,但这次我关闭了思考。
它使用了大约 12K tokens,生成网站的速度明显更快。
这是一个特别有用的对比,因为它展示了推理模式本身对本地生成时间的影响有多大。
8. Ornith 1 9B Q4_K_M
约 2.4 分钟
* 模型大小:约 5.4GB
* 约 74 tok/s
* 原生上下文:最高 262K
* 这次生成只用了约 2.6K tokens
这是本地组的速度怪兽。
9. Ornith 1.5 35 A3B Q6
约 30 tok/s
* 模型大小:约 22.4GB
* 约 30 tok/s
* 本次运行可用上下文:约 128K
* 由于模型太大,显然非常依赖卸载(offloading)
快速总结
| # | 模型 | 大约耗时 | 本地? | 生成速度 |
|---|---|---|---|---|
| 1 | Gemini 3.8 Flash | 约 3:12 | ❌ | — |
| 2 | GPT-5.6 Sol | 约 1:06 | ❌ | — |
| 3 | Claude Sonnet 5 | 约 4:56 | ❌ | — |
| 4 | Bonsai 2 27B Ternary | 约 45 分钟 | ✅ | 约 34–36 tok/s |
| 5 | Qwen 3.8 27B GSQ-RCO-IQ3-XXS + MTP | 约 57 分钟 | ✅ | 约 29–40 tok/s |
| 6 | Qwen 3.8 27B Q4_K_M Unsloth Dynamic 3 | 2+ 小时 | ✅ | 满上下文约 4 tok/s,空上下文约 8 tok/s |
| 7 | Qwen 3.8 27B GSQ-RCO-IQ3-XXS, thinking OFF | 约 12 分钟 | ✅ | — |
| 8 | Ornith 1 9B Q4_K_M | 约 2.4 分钟 | ✅ | 约 74 tok/s |
| 9 | Ornith 1.5 35 A3B Q6 | — | ✅ | 约 30 tok/s |
我的个人看法
对于本地模型,最让我印象深刻的是 Qwen 3.8 27B GSQ-RCO-IQ3-XXS。
它在以下几个方面取得了相当有趣的平衡:
* 实际设计质量
* 编码能力
* 上下文处理
* 生成速度
* 适配 12GB GPU 配置
Qwen 3.8 27B Q4_K_M Unsloth Dynamic 3 从质量角度也很有趣,但一旦深入上下文,速度损失非常巨大。
Bonsai 2 27B Ternary 作为约 7.66GB 的 ternary 模型,也出人意料地可用。
所以排名是:Qwen 3.8 27B Q4_K_M > Qwen 3.8 27B GSQ-RCO-IQ3-XXS > Bonsai 2 27B Ternary
我附上了显示输出结果的屏幕录像。
特别想看看其他 RTX 3060 / 12GB 配置的结果 ;0
如果可能的话,有 Codex 订阅的人请把 GPT-6-ASTRA 的结果发下来。
―― 高票评论(帖子共 31 条讨论)――
[+18] u/MLDataScientist: 有意思。是的,我同意 ista-daslab 的 gsq-rco 模型真的很好。你能分享一下你运行 Qwen 3.8 27B GSQ-RCO-IQ3-XXS + MTP 的命令吗?我也是 12GB 显存。但我用 mtp 权重在 llama.cpp 里最多只能塞进 32k 上下文。
[+3] u/_wortkarg_: 我原本也预计 Qwen3.8-27B GSQ-RCO-IQ3-XXS 会有最好结果,这可能是 12GB 显存的最佳选择。我不会关闭思考;相反,我会把它的档位从 “xhigh” 改成 “medium”(“medium” 通常比 “xhigh” 快很多)。DFlash2 提供更快的速度(大约比 MTP 快 15%),但它也占用更多显存(analogalok/Qwen3.8-27B-DFlash2-Q2_K-GGUF 磁盘占用约 700 MB,而 MTP 约 350 MB)。Ornith 1 9B …… 为什么不用 Ornith-1.5-9B?倒不是说 9B 模型在 12GB 上有多大意义,但还是。Ornith 1.5 35 A3B 和约 30 tok/s —— 我在我的 5060 Ti 16GB 上跑 Ornith-1.5-35B-Q4_K_M 能达到 90 tok/s。我预计 3060 上会有 50-60 tok/s。根据我的经验,找到 --n-cpu-moe 的最优值能显著提升速度(对所有 MoE 模型都是如此)。你也可以试试 KAT-Coder-V2.5-Dev;它在基准测试中不如 Ornith-1.5-35B,但根据许多实际使用评价,它实际上表现更好。在我的测试中,它完成这个任务的速度快了一倍(即使没有 MTP)。对于非常简单的任务,我还会考虑 Ling-3.0-tiny。这个模型不如 Ornith-1.5-9B,但它非常快(比 Ornith-1.5-9B 快 2 倍),而且上下文占用的显存要少得多(比 Ornith-1.5-9B 少约 5 倍,比 Qwen3.8-27B 少 9-10 倍)。
[+3] u/roloroulette: 结果很有意思。保存了,因为我正在用 3060 从头学 CUDA。这卡足够便宜,或许值得再买一块,看看这个显存档次能跑多远。
[+2] u/CodeCatto: 有意思。我回头看看我的机器上 bonsai 2 能跑出什么。
[+2] u/d70: 这几天我一直在用 5.6 Sol,和 Opus 相比它的速度和效果都让我很惊讶。我本地还是选择 Qwen3.8 27B。
[+1] u/128G: 网站 5 看起来最好。
[+1] u/ggwpezz: 我有兴趣看看 https://huggingface.co/byteshape/Qwen3.8-27B-GGUF 里的 iq3-xxs 和你这里测的 GSQ 量化相比如何。从我有限的测试来看,它似乎稍微好一点,同时还小了大约 500MB,所以这可能是个有趣的对比。
[+-5] u/niacolhealth: 同样的提示词,云端模型 1-5 分钟完成,本地模型要磨将近一个小时。耗时不会说谎,这就是取舍。