AMD和NVIDIA显卡一起跑大模型,开源工具免去同型号配对
一个叫 Infermeld 的开源 Linux 工具包,能让一块 AMD 显卡和一块 NVIDIA 显卡跑同一个大模型。推理引擎是 llama.cpp。作者在发布说明里明确说,Infermeld 不是新的推理后端,也没有发明混合 GPU 推理。
本地跑大模型,显存经常不够用。权重文件要占掉一大块显存,单张卡装不下,就得想办法把显存凑起来。Infermeld 的做法是:不必同型号,A 卡和 N 卡也能一起工作。
源代码发布,自己动手
Infermeld 目前是实验性 v0.1.0 版本,发布方式只有源代码,没有安装包。要跑起来,需要按文档自己编译指定版本的 llama.cpp,再准备一份模型权重文件。它面向熟悉 Linux 和实验环境的人,不是一键安装程序。
这个工具把混合 GPU 推理拆开处理:AMD 显卡走 Vulkan 后端,NVIDIA 显卡走 CUDA 后端。哪张卡承担哪一部分,由启动参数指定,运行前会做一次预检。构建说明和启动参数都可复现、可检查。
它还带一个只读热保护。温度过高时,只关闭自己启动的服务器进程,系统里的其他进程不受影响。文档和结果站点公开记录配置、失败案例和限制。
测试只覆盖一对显卡
作者用来验证的硬件是一对固定组合:AMD RX 6900 XT 16GB 加上 NVIDIA RTX 3080 10GB。模型是 Qwen3.6-35B-A3B,量化格式 UD-Q4_K_M GGUF。分割模式是层分割:把模型的网络层拆开,一部分由一张卡算,另一部分由另一张卡算。上下文预留 8,192 tokens。验收检查包括模型加载和短补全,MTP(多 token 预测)关闭和开启都测过。
作者也明说了,这是窄结果:只来自这一对硬件,不是广泛的兼容性测试。8K 上下文预留只是预留空间,不等于真的把 8K tokens 的提示填进去完整跑一遍。短补全成功,也不等于长时间运行的稳定性能。持续 Q4 吞吐量、全长度高上下文的结果,目前都没有数据。历史测量值都标注了原始配置,不能拿来当作当前这套 Q4 设置的性能参考。能跑哪些模型架构、以后会不会有预编译二进制,也还没有说明。
容量不等于速度
还有一件事得说清楚:两块显卡的标称显存加起来,不保证全部能被模型和运行时使用。把两张卡凑在一起,为的是扩展显存容量;作者没有承诺它比单卡更快。容量相加不等于速度相加,这一点在尝试之前应该知道。
用反馈补上空白
作者在找用其他混合 GPU 组合的人,来复现这套设置并找出边角问题。成功和失败的案例都有用。提交报告时,硬件信息要写全:两张卡的型号和显存大小,操作系统和驱动版本。软件这边也要写:llama.cpp 版本,模型和量化格式,启动参数(层分割和上下文预留)。还要说明进展到了哪一步——预检、加载、第一次补全,还是更长的工作负载。仓库里有专门的问题表单,要求清理路径,不要把凭据和私人日志带进报告。
相关地址都在 GitHub 上:仓库 github.com/5p00kyy/infermeld,结果站点 5p00kyy.github.io/infermeld。作者还在问,有没有人已经在用 AMD/NVIDIA 组合做本地推理。他想知道哪些配置能稳定跑起来,哪些硬件上会出问题。
Infermeld 目前能证明的,只是在一块 RX 6900 XT 和一块 RTX 3080 上跑通了一个 35B 模型。其他组合上的兼容性、持续负载下的表现,要等反馈回来才有答案。