RTX 3090免费跑27B模型,速度超付费API但默认质量打折
GitHub上出现了一个针对英伟达Ampere架构优化的llama.cpp分支,名为llamAmpere。作者说,在自己的RTX 3090上跑27B模型,本地速度已经超过付费API。模型加显卡的实用性,在他这里上了一个大台阶。对个人开发者来说,这条路不花钱,代码也不用上传到云端。
推荐配置下,100K token上下文能跑到90+ TPS。温度设为1、用于编程或agent任务时就是这速度,贪心解码还会更快,上下文上限240K。作者另给了一组对比:200K上下文下比接近的竞品快80%,还附了篇细讲加速原理的长文。
但默认配置的质量有问题。作者推荐使用一个来自Hugging Face的量化模型文件。他称其质量接近4 K M、速度更快,技术上算是3 K XL的升级。一位实测用户给出不同结论:95 TPS的速度不假,默认量化模型的质量却不可接受。他的改法:编译时开启all-quants,KV缓存改用q8_0和q5_1,模型文件换成byteshape版。这套配置在262144上下文下速度能到85 TPS,质量也有保证。另一位用户看了实测后说,这才是真正的推荐配置——同样的速度,没有默认量化的质量问题。
分支目前还是独立仓库,没有并入上游llama.cpp。有评论者说,最好以补丁或PR的形式提交,或者至少保留fork形态方便和基础代码对比。独立的仓库难审计。多卡兼容性也没有确定答案。有人问3060能不能成对跑,也有人问30系列和其他系列混插行不行。有没有视觉支持、能不能用Unsloth或Bartowski的量化文件,作者还没给出明确说法。
同类分支并不少。ninfer-3090更流行,qwen38-27b-rtx3090主打速度和上下文。myllama.cpp的路子不一样,专门把视觉部分放到第二张GPU上优化。已经有人准备在双3080 12GB机器上尝试。也有人拿着双3080 20GB,说试完会报告结果。一位评论者的评价是,针对特定GPU优化的模型很棒,潜力还剩很多。
分支进官方代码库的事,目前没有动静。按显卡做针对性优化的回报,已经有实测验证。