AI Pulse

跑大模型单次成本高得离谱,但用户一多就划算

测试者在Modal云平台上租了8块B300 GPU,托管Kimi K3。这个模型有2.8万亿参数。测试用的是vLLM,张量并行度8,权重格式原生MXFP4。

冷启动花了约27分钟:加载1.56TB数据、即时编译、51次CUDA图捕获。跑起来之后,首令牌延迟0.92到1.02秒,解码稳定在每秒92个token。4个提示平均每秒83个token。

成本方面,测试者列出的数字是:每小时56.79美元。一次完整测试约36美元GPU时间。保持热启动,每天1363美元。按输出量折算,每百万输出token成本190美元。完整报告、部署文件和原始基准数据都公开了。

便宜硬件反而更贵

测试者又做了一组对比:用Unsloth的Dynamic GGUF把Kimi K3压到1位量化。UD-IQ1_S版本共594GB,正好放进8块A100-80GB,通过llama.cpp运行。1位量化就是把每个参数压到约一个比特。

A100每小时19.99美元,约为B300的三分之一。但速度掉到每秒约9个token,首令牌延迟拉到7到60秒。每百万输出token成本约620美元,是B300的3.3倍。

评论区有读者指出,有意思的不是B300,而是GGUF这组数字。1位量化在A100上,每个token的成本高过B300全精度。吞吐量对成本的影响,远大于硬件每小时的价格。

1位量化下的输出质量没崩:算术正确,散文连贯。

单看每百万token是误导的

高票评论对测试提出两点质疑。其一,成本效率来自并行服务多个用户,单看每百万输出token的成本会误导人。其二,1位量化会破坏模型的知识和能力,与全精度比较不公平。

另一条评论说得直接:没有高吞吐的并行推理系统,为这种基础设施付费没有意义。

评论区还有具体建议:有人建议跑DeepSeek V4 Flash。也有人建议下次用nvfp4格式,配合sglang或vllm做并行服务。

还有人好奇,是否存在一个4位量化的中间配置,能在速度和成本上同时胜过两种方案。测试数字是否包含推测解码加速、租金具体包含哪些费用,测试里都没有给出答案。

用API反而便宜得多

Kimi K3官方API每百万输入token 3美元,每百万输出token 15美元。自托管折算出来是190美元。这190美元是单人跑出来的结果,API的15美元背后是大量用户共享同一批硬件。评论区的高票意见也指向这一点:成本要按并行用户数摊开算。

如果你不运营大规模AI服务,这个测试没有直接意义。它展示的是顶级硬件跑超大模型的成本结构。有人表示,这个模型太大,不适合个人陪伴或角色扮演。个人需要的是能在普通硬件上跑的模型。

超大规模模型的成本结构,决定了它首先是基础设施生意。1位量化能在2.8万亿参数上保持连贯算术,这谈不上量化技术的胜利。只是这个规模的模型冗余太多。

阅读原文
📚 相关主题 大语言模型AI部署AI推理

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新