AI Pulse

三张RTX 3090攒出本地工作站,摆脱OpenAI/Anthropic订阅

他不喜欢把不可替代的订阅挂在OpenAI或Anthropic身上。他担心哪天离开这些工具就没法干活,于是转向了本地模型。他用三张RTX 3090攒了台工作站,把搭建过程发在了Reddit上。

硬件:从16GB到64GB

他原来的显卡是RTX 4080,16GB显存。跑本地模型,精度和上下文窗口都很受限。为了多塞几张卡,他选了Fractal Design的Meshify 2 XL机箱。当时Meshify 3 XL已经上市,但没有内置尼龙防尘滤网,这一点他没法妥协。Meshify 2 XL理论上塞得下4张3090 FE尺寸的卡。可电源和主板只允许装3张。

电源是Corsair HX1500i SHIFT,一共只有6个8针接口,最多带两张3x8针的显卡。接口不够,他只好把一张非公版3090换成Founders Edition。FE卡只需要两个8针接口。为了保险,两张3090都被限制在300W。

最麻烦的是第三张卡。他用了CoolerMaster V3垂直安装支架,原装PCIe riser长度不够,得换。500-600mm的延长线才够得着第三张卡,400mm不行。显卡竖直挂载,热气朝上排,底部加了防下垂支架。他觉得市面上大多数PCIe 5.0长riser都是骗局。没有额外供电和信号中继器,信号质量很难保证。riser本身也没有牢固固定在主板槽上,中等力度就能拔出来。

软件:自编译llama.cpp,跑Qwen3.8-27B

他用自编译的llama.cpp,开了CUDA、Flash Attention和NCCL。模型是Qwen3.8-27B-MTP-Q8_0,上下文262144。MTP预测和推理保留都开启,推理强度设为xhigh。

这是主力桌面机,没法无头运行。系统和其他应用要占掉2-3GB显存,实际可用约62GB。跑Qwen3.8-27B Q8、占满262144上下文时,还剩10-12GB空闲显存。这些余量可以用来试其他模型,或者把上下文拉得更长。

速度随上下文占用量逐步下降。开头44-46 tokens/s,快占满时降到28-30 t/s。全程能用,就是明显变慢。

工作流:手写代码为主,AI处理小任务

他还是以手写代码为主。AI代理只接中小型无聊任务:打草稿、探索方案、搜文档、做每周项目评估。它还会给优化和bug修复建议,辅助项目管理。他强调,依然感觉是自己在写软件,而不是盲目接受AI生成的内容。

接下来他打算试Unsloth Dynamic Q_8_XL和一些MoE模型。他觉得答案质量和代理自主工作的水平,跟模型精度直接相关。

评论区:几条不同的路线

Short_Regular_7191配置类似,但只用了两张RTX 5060 Ti(各16GB)。他跑Qwen 27b Q6,131k上下文,速度约50 tokens/s。整套花了1200-1300欧元。他把Claude Max从20x降到了5x,预计一年内回本。

kansasmanjar0建议用niri这类窗口管理器,把浏览器和IDE占用的显存挪到系统RAM。这样能省出2-3GB。lemondrops9提到eGPU方案,连接和供电更省事。Hour_Willingness_443说这套配置跑本地角色扮演机器人也够强。显存一够,上下文能拉长一大截,体感完全不同。

也有质疑的。arthor追问DRAM、CPU和硬盘配置,说自己算下来1600W电源不够,三张显卡就要吃掉1000W。sultan_papagani更直接:真做软件工程师,就上班攒钱买更好的系统,跑比27B更大的模型。否则这套配置没意义。

BP041给了另一种思路。64GB VRAM确实不错,但48GB的Mac Studio也能干很多事,只要忍得了Apple Metal的怪癖。他的配置跑Claude Code加OpenClaw,多代理工作流没问题。真正的瓶颈是上下文管理,不是VRAM。

从这台机器的折腾过程看,本地AI的代价远不只是显卡价格。电源接口、机箱结构、PCIe延长线长度,每一环都可能变成新的限制。

阅读原文
📚 相关主题 本地大模型开源

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新