AI Pulse
📡 X 信号

原生Windows终于支持AMD多GPU协同推理了

原生Windows终于支持AMD多GPU协同推理了

🚀 原生Windows AMD多GPU推理现已推出——而且现在已经开源了。

不需要WSL,也不需要两个互不关联的推理服务器。只需要一个同步模型,拆分到多个AMD GPU上运行。

我发布了两个干净、可更新的项目:
• vLLM for AMD — vLLM v0.28.0 + ROCm 10 原生运行在Windows上。
• Windows AMD Multi-GPU Bridge — 一个外部、固定版本的通信层,结合了Direct-RCCL、GPU调度的D3D12跨适配器AllReduce,以及基于集合通信类型和负载大小的混合路由。

Direct-RCCL处理通用集合通信路径,D3D12处理选定的双GPU AllReduce负载,混合路由器会自动选择合适的传输方式。

该桥接作为插件运行在vLLM源码树之外,未来还会推出ROCmFPX插件。

这意味着:
• 不会向推理引擎注入任何传输代码
• 下游更新更干净
• 一个通信项目就能服务两个生态系统

在发布时,上游vLLM仍然不支持原生Windows,而AMD的Windows支持矩阵将RCCL列为不支持。

在我的公开代码搜索中,我没有找到其他任何LLM栈以这种方式结合Windows RCCL + D3D12跨适配器AllReduce + 混合路由。我不会声称这绝对是全球首创(但我在其他任何地方都找不到它),但这可能是这种精确架构的第一个公开实现。

参考系统:2× Radeon AI PRO R9700

提供了以下架构的编译目标:RDNA 3 • RDNA 3.5 • RDNA 4

这是一个仅提供源代码的实验性发布。请在本地编译,阅读验证和安全说明,测试它,调试它,跑分它,帮助改进原生Windows AMD多GPU推理。

vLLM for AMD:
Direct-RCCL / D3D12 Multi-GPU Bridge:

未来几天和几周内,我会继续优化模型,找到调优效果最好的参数。

#AMDAI #AIAMD

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新