四百万美元的服务器不用买,AI服务反而可能更便宜
硬件的账
Qwen 3.8 2.4T 跑进了英伟达 GB300 NVL72。FP8 精度,没做额外调优,上线首日就达到每秒 28.8 万 token;每块 GPU 每秒出约 4000 token,换算到每个用户是每秒约 350 个。NVFP4 这类优化还没启用,按预期,性能还能再涨。
这台机器不进家门
这套系统不是给个人用的。评论区有人调侃:“太本地了,谁赶紧去搞一台 GB300 NVL72。”还有人问这块 GPU 在 Microcenter 有没有得卖、该用 Ollama、llama.cpp 还是 vllm 跑。另有人提醒:这是云服务,该发去 r/CloudLLaMA。整套设备约 400 万美元,加上电力与散热,天生属于机房。
折旧,以及 token 的单价
评论区算过一笔成本账:硬件按两年折旧,加上电力和冷却,一小时约 400 美元,一分钟约 6.6 美元。想回本,每百万 token 要卖约 44 美分,前提是 100% 负载;现实达不到,所以可能要卖到 1 美元。模型当前的 API 价格是输入 2 美元、输出 6 美元每百万 token。评论区据此判断:这可能是一门赚钱的生意。
350 这个数字的分歧
每秒 28.8 万是整机峰值,每秒 350 是人均值。两个数字之间隔着并发数,评论区有两种推演,差了十几倍。一种拿 4000×72÷350,得出约 822 人同时在线;另一种对照图表后认为,4000 token/s/gpu 只够每人分到 8-10 token/s,350 对应的是 40-50 个人独占整机时的速度。负载不交代清楚,峰值再高也没法换算成每个人的实际体验。
跑分不能这么比
不同模型、不同硬件之间,不能直接把峰值跑分拿来比。几个月前,Reddit 有人晒出 H200 集群跑 Qwen3.5-27b 的数据,每秒 100 万 token。模型更小、硬件更旧,吞吐量却是这次的三倍多。单看峰值,会得出“新硬件更慢”的错觉。评论区真正在算的是单位成本:硬件折旧、电力和冷却摊到每百万 token 上,再看 API 定价能不能覆盖。