AI Pulse

四百万美元的服务器不用买,AI服务反而可能更便宜

硬件的账

Qwen 3.8 2.4T 跑进了英伟达 GB300 NVL72。FP8 精度,没做额外调优,上线首日就达到每秒 28.8 万 token;每块 GPU 每秒出约 4000 token,换算到每个用户是每秒约 350 个。NVFP4 这类优化还没启用,按预期,性能还能再涨。

这台机器不进家门

这套系统不是给个人用的。评论区有人调侃:“太本地了,谁赶紧去搞一台 GB300 NVL72。”还有人问这块 GPU 在 Microcenter 有没有得卖、该用 Ollama、llama.cpp 还是 vllm 跑。另有人提醒:这是云服务,该发去 r/CloudLLaMA。整套设备约 400 万美元,加上电力与散热,天生属于机房。

折旧,以及 token 的单价

评论区算过一笔成本账:硬件按两年折旧,加上电力和冷却,一小时约 400 美元,一分钟约 6.6 美元。想回本,每百万 token 要卖约 44 美分,前提是 100% 负载;现实达不到,所以可能要卖到 1 美元。模型当前的 API 价格是输入 2 美元、输出 6 美元每百万 token。评论区据此判断:这可能是一门赚钱的生意。

350 这个数字的分歧

每秒 28.8 万是整机峰值,每秒 350 是人均值。两个数字之间隔着并发数,评论区有两种推演,差了十几倍。一种拿 4000×72÷350,得出约 822 人同时在线;另一种对照图表后认为,4000 token/s/gpu 只够每人分到 8-10 token/s,350 对应的是 40-50 个人独占整机时的速度。负载不交代清楚,峰值再高也没法换算成每个人的实际体验。

跑分不能这么比

不同模型、不同硬件之间,不能直接把峰值跑分拿来比。几个月前,Reddit 有人晒出 H200 集群跑 Qwen3.5-27b 的数据,每秒 100 万 token。模型更小、硬件更旧,吞吐量却是这次的三倍多。单看峰值,会得出“新硬件更慢”的错觉。评论区真正在算的是单位成本:硬件折旧、电力和冷却摊到每百万 token 上,再看 API 定价能不能覆盖。

阅读原文
📚 相关主题 大模型AI硬件

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新