AI Pulse
📡 X 信号

DeepSeek用不到1%成本拿到Claude超八成能力

DeepSeek真正可怕的,已经不只是Token便宜。

Artificial Analysis最新数据显示,在同一套AI综合能力评测中:DeepSeek V4 Flash 0731的平均任务成本只有0.03美元,综合指数50。 Claude Fable 5的平均任务成本则达到3.15美元,综合指数60。

也就是说,DeepSeek用不到1%的成本,拿到了Fable约83%的综合能力。

这里需要注意,所谓“便宜105倍完成相同任务”,指的是运行同一套评测题目的成本,并不代表两者获得了完全相同的结果。 Artificial Analysis的Cost per Task统计的是每次运行任务的平均Token账单,而非每道成功任务的成本。

但这仍然揭示了一个很重要的变化:过去大家比较模型,主要盯着每百万Token多少钱。 到了Agent时代,真正决定一个产品能否大规模运行的,是每个任务最终花多少钱。

一个Agent可能需要连续思考几十轮,反复调用工具,失败后重新尝试。 单次Token价格再低,只要模型啰嗦、成功率低、需要不断重试,最终账单依然可能很高。

DeepSeek这次证明,它不只是在Token价格上便宜。 即使把真实推理长度、缓存、工具调用和输出消耗全部计算进去,它的综合任务成本依然只有头部模型的零头。

当一次复杂AI任务的成本从几美元下降到几美分,很多原本只适合服务高价值客户的Agent产品,才可能真正进入高频、大规模使用阶段。 相比bench上领先几分,这才是我认为真正最值得大家关注的地方。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新