推理速度提至670 tok/s,价格只要原厂的几分之一
我想从这条新闻讲讲 AI inference 为什么值得搞,怎么帮企业赚钱,从我本职工作出发,讲讲工业界的几套主流路线 事情是:RunInfra 把 GLM 5.3 Flash 优化到了 670 tok/s,价格只有 $0.11/M input、$0.45/M output。是 原厂 API / 基准的很多倍。类似于 /UltraFast的概念,而且成本价格没变,剩下的差价,都是企业真金白银的利润 背后的原理其实很简单: 普通部署 LLM,GPU 很多时间并不是在“算”,而是在 搬显存、启动 kernel、等通信、重复读写数据 所以我们优化简单来说主要干几件事,几种主流优化方向: > Kernel Fusion:Norm、quant、MoE routing、GEMM 尽量一次做完,少来回读 HBM > 开发专用 Attention / MoE kernel:GLM 本身有 sparse attention + MoE,通用 vLLM 不一定能把硬件吃满 > Speculative Decoding / MTP:一次 forward 尝试生成多个 token > Prefix Cache:Agent 每轮大量重复 prompt 不重新算,RunInfra 说过去 24h cache hit 甚至到 99.7% 所以同一个模型,可以从几十、上百 tok/s,直接被推到几百 tok/s。
我认为: 模型权重人人都能用,真正拉开成本和速度差距的,是下面那个 execution engine。