跑AI大模型,不必先买顶级显卡
平价硬件
作者自托管过大语言模型,用的都是平价硬件:6块RTX 3060 12GB、Intel Arc Pro B60 24GB、RX 9070 XT。在他看来,买不起顶级显卡不意味着与大模型无缘。中低端硬件配上调优技巧,速度和效果就能进入可用范围。
他把这套经验写成4篇文章。第一篇讲通用原则,第二篇讲硬件与推理优化。第三篇讲CPU+RAM卸载、MoE、推理速度和基准测试,第四篇讲前端与完整配置示例。
社区反响
文章发到网上后,有人建议转发到r/LowEndLocalAI。那是Reddit上专门讨论低端硬件跑本地AI的版块。一位有技术背景、刚接触AI的评论者说文章写得很好。另一位正在公司部署本地AI的评论者说,过去几个月全靠自己摸索,这套文章能帮同事快速上手。还有人提到在linuxfr.org上读过,觉得内容详细且有趣。
这几条反馈指向同一个现实:平价硬件跑AI,确实有人需要。
调优技巧
最具体的技术讨论是:把MoE模型的专家层卸载到CPU时,需要手动调整batch和ubatch大小。默认调优是针对GPU的。调好后,prefill速度可以轻松提升2-3倍,但会占用计算缓冲区,留给KV缓存的空间会少一些。
有人看完第3篇文章后,做了个免费在线工具WatchMachineGo.com,用来可视化和模拟LLM推理概念。这个工具无广告、尊重隐私,制作者还打算在有空时开源。
不同的声音
也有人觉得,文章没有特别提到llama.cpp的具体配置或用了哪些模型,看起来像基础入门内容。对低显存配置没有额外好处。
一位评论者把自托管与云服务比作买房和租房。自托管要前期投入和维护,但长期拥有控制权;云服务灵活,但规则由服务商定。