谷歌开源ML Drift:称GPU推理性能提升一个数量级
ML Drift是LiteRT(谷歌设备端推理框架)的核心GPU加速引擎。它也可以作为独立库,放进自定义的图形或推理运行时。谷歌说,相比现有开源GPU推理引擎,性能提升有一个数量级。
它要解决的是设备端GPU的碎片化。OpenGL ES、OpenCL、Metal、WebGPU标准各不一样,开发者自己做适配,得抠一遍底层细节。ML Drift把这层复杂性包住,让同一套AI模型跨后端跑。它还提供统一的核语言,省掉一部分跨平台开发成本。
Android上的主力API选了OpenCL,评论区围着这个选择讨论了一轮。OpenCL在Android上曾经很普及,近几年退居二线。有评论者原以为谷歌会优先上Vulkan计算着色器。有开发者解释了背后的驱动现实:Adreno GPU在OpenCL下可以把权重放进纹理内存。计算用fp16、累加用fp32,成本很低。Vulkan的subgroup和coopmat支持,在不同版本的Mali上不稳定。另一个代价是,libOpenCL.so从来不是Android NDK的标准库,得靠dlopen动态加载。有些设备上干脆没有这个文件,所以ML Drift保留了GLES回退路径。
评论区的态度并不一致。有评论者直接问:现有工具没解决什么问题,值得谷歌自己再做一个引擎?也有人觉得它不像只是llama.cpp的替代品,但希望有人用大白话解释一遍。还有评论者夸了LiteRT。
落到实际使用上,实时视频特效、生成式AI这类计算密集的东西,在接入ML Drift的应用里会更流畅。不同Android设备之间的性能差异还在:回退机制保证基本能用,不保证体验一致。目前公开的性能数据集中在移动平台。谷歌没有给出和vLLM、llama.cpp在CUDA/Vulkan上的对比。桌面端的性能优势,还没有公开数据支撑。