AI Pulse
📡 X 信号

Deepseek V4 Flash 0731 Fast 登陆Vercel AI Gateway,峰值887tps

Deepseek V4 Flash 0731 Fast 登陆Vercel AI Gateway,峰值887tps

为了庆祝在 Vercel AI Gateway 发布 Deepseek V4 Flash 0731 Fast⚡️(最高可达 887 tps),我们推出 Deepseek 深度解析第三部分!

过去五年里,所有稀疏注意力方法都是在推理时把稀疏性硬加到预训练模型上,效果都输给了全注意力,但 Deepseek 的 NSA 是从头开始训练稀疏性的。下面讲解其中的诀窍:

稀疏注意力输给全注意力已经五年了。所有方法都是在推理时把稀疏性硬加到预训练模型上,权重从来没有学习过在不保留所有键的情况下工作。NSA 则是从头开始训练稀疏性。

它有三个平行注意力分支,独立的 K/V 投影,通过一个可学习的 MLP 门组合。压缩分支把键和值压缩成步长 16、大小为 32 个 token 的块,然后通过可学习 MLP 把每个块合并成单个键。在 64k 上下文下,最终只会得到 4000 个压缩键,而非 65000 个。

选择分支为每个查询选出排名前 16 的 64 token 块,也就是从历史任意位置选出 1024 个精心挑选的 token。第三个分支是用于局部上下文的 512 token 滑动窗口。

巧妙的地方在于,top-k 打分是免费的。压缩分支已经对所有压缩键做了 softmax,这些 softmax 值本身就是块的重要性分数。不需要二次遍历,也不需要额外的矩阵乘法。

更巧妙的设计适配了 GQA。Quest 和 InfLLM 按每个头选择块,16 个头选出的块的并集会导致规模爆炸,因为每个头选的块都不一样。NSA 会对一个 GQA 组内的分数求和,然后运行一次共享的 top-k。一次 KV 块加载就能喂给 16 个并行 MMA。

在 64k 上下文下,NSA 每个解码步骤读取的字节比全注意力少 11.6 倍。已发布的 H100 选择内核在 128k 前向传播时比 FlashAttention 快 16 倍,反向传播快 22 倍。

在 LongBench 上,NSA 得分 0.469,全注意力得分 0.437,精确顶值预言机得分 0.423。精确顶值会看到真实注意力分数,每次都选出真实的前 n 块。NSA 甚至不需要计算真实注意力就能赢。

用稀疏性训练会改变权重学习编码的内容。预训练权重会让信息流经每个位置,因为它们可以这么做。NSA 权重会让信息流经稀疏机制可见的块。

六个月后,Deepseek 在 V3.2 推出了 DSA(一个闪电索引器,fp8,token 级 top-2048 选择),128k 上下文的 API 价格下降了 7 倍。

然后稀疏注意力终于生效了,但只有在他们停止 retrofit 改造之后才实现。

@gpuemi 技术深度解析

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新