开源工具包让AMD显卡跑AI提速59%,AI服务更便宜、响应更快
dstack开源了一个工具包。它让Qwen3.8-27B在单块MI300X上跑得更快。速度从311 tokens/s拉到495 tokens/s,提升59%。这个成绩在完整100万token上下文下测出。首token时间低于1.5秒,同时服务四个并发用户。不是短文本场景刷出来的数字,长对话、长文档都能保持。
提速来自两处。一处是源代码级补丁,打在SGLang的AITER注意力后端上。另一处是一连串优化会话。改完的结果打包成一个可移植的预设。任何AMD云、Kubernetes集群或裸机集群,都能直接部署。
评论区有人指出,AMD自己的Hyperloom项目正在做类似的事。有用户一直在等二手MI210降价,想买一两块搭家庭实验室。还有人问,有没有预设注册表,能按GPU小时成本选出某模型的最快方案。
有评论担心FP8 KV缓存会损害长时间任务的质量,还拿RTX 5090做对比。它装下Q4_K_M量化和约100k上下文的F16 KV缓存,就已经很满。性能还差不少。
目前还没有预设注册表公开出来。MI210的适配效果、FP8 KV缓存对长期任务的影响,也都没有数据。