DeepSeek-V4.1-Flash 是 DeepSeek 新架构家族中体量最小的成员,定位为原生支持多模态、支持百万级上下文的新一代模型,已上线 HuggingFace、App、Web 和 API 四个入口 [7]。它同时也是 V4.1 的中间版本,更换了新的架构底座,官方强调的特点是能力更强、速度更快、成本更低 [1]。围绕它的架构变化,社区讨论最集中的是参数规模、缓存机制和底层实现这三块。

先看模型的骨架。V4.1-Flash 是一个混合专家(MoE)架构的模型,主干参数规模为 552B,但实际推理时的激活参数只有 8B 和 16B 两档 [2]。这个激活分档和运行阶段有关:解码阶段激活 16B 参数,预填充阶段激活 8B 参数 [16]。同属 MoE 架构的对比项是,DeepSeek-V4-Flash-Base 的主干参数为 284B、激活 13B,DeepSeek-V4-Pro-Base 的主干参数为 1.6T、激活 49B [2]。也就是说,V4.1-Flash 把主干规模推到了上一代 Flash 的近两倍,但同时把激活参数压得更低。

除了常规的 MoE 专家结构,社区还从权重中读出了额外的组件。Reddit 上的讨论提到该模型是 552B MoE 加上 196B 的 Engram,并且模型文件以 8 位格式发布,而不是 V4-Flash 发布时的 4 位 [16]。有用户据此估算,N-gram 相关的权重约为 204 GB,如果改用 4 位量化,306 GB 的 8 位权重大约会落到 155 至 160 GB,和 V4-Flash 体量相当 [16]。同一条讨论还指出模型采用了 QAT 的 KV 缓存并使用 FP4 精度 [16]

缓存压缩是这一代架构最实质的变化。V4.1-Flash 用新架构把长上下文推理的缓存占用砍到原来的四分之一 [19],论文层面的结论是长任务部署成本随之大幅下降,但受益方主要是跑大模型服务的团队,而不是普通用户明天就能摸到的功能 [19]。在具体数值上,V4.1-Flash 相对于 V4-Flash 和 V4 分别实现了约 4 倍和 437 倍的缩减 [2]。更少的 KV 缓存对代理场景格外有利,因为代理会反复读取同一批上下文,缓存命中率越高,实际成本越低 [12]。放大到整个 V4 系列的技术脉络,这一代用压缩稀疏注意力(CSA)和重度压缩注意力(HCA)取代了单一的注意力堆栈,使模型能够处理 1M token 级别的上下文 [10]

多模态是另一条主线。V4.1-Flash 原生带有视觉理解能力,并支持 1M 上下文 [7],API 测试版本同样被描述为原生支持多模态 [1]。在部署侧,vLLM 在首日就提供了对 V4.1-Flash 的支持,可在 NVIDIA 和 AMD GPU 上运行,原生视觉、百万上下文这些特性可以直接用上,无需重新适配底层技术栈 [9]。硬件要求方面,有资料显示它能在 4 张 DGX Spark 上跑百万上下文,默认支持 800 万 KV 缓存和 8 个并发会话,并已通过百万上下文测试 [13]

底层实现上和以往版本有明显不同。有用户在 Hugging Face 讨论中指出,这不是一个常规的 .1 版本发布:架构变成了编码器/解码器结构,模型尺寸不同,可能涉及新的预训练,聊天格式的实现改用了 Python 和 Rust 而没有使用 jinja2 [16]。同一讨论也提到,这种改动可能意味着要等一段时间才能等到 llama 生态的支持 [16]。另一位用户的评论则把变化归纳为转向 fp8、开始使用 N-gram,以及参数数量的增加,并调侃说变化这么多,也许不该再叫 Flash 了 [16]

性能表现上,速度是评论区最热闹的话题。有说法称快了约 2.24 倍;也有基准测试观察到 token 效率提升了最多 30%,这被用来解释低成本的说法 [1]。不过怀疑的声音同样存在:速度提升可能来自复用的架构,加上当前并发用户不多,未必是真优化 [1]。在基准测试中,V4.1-Flash-Base 在 MMLU-Pro 上得分为 74.1,高于 V4-Flash-Base 的 68.3 和 V4-Pro-Base 的 73.5;C-Eval 得分为 92.1,与 V4-Flash-Base 持平;AGIEval 得分 83.4,略低于 V4-Flash-Base 的 83.9 [2]

最后是使用与生态层面的架构含义。调用方式上 base_url 不变,只需把模型名改成 deepseek-v4.1-flash-expires-on-0910,定价与 deepseek-v4-flash 相同,每个账户并发限制 20 个请求 [1]。有观点认为,想用好 V4.1-Flash 需要搭配 Harness,单独测裸模型看不出真实能力,下半场比拼的是模型加工具的组合 [6]。社区对它的评价也有分歧,有人认为它是可用小模型的底线 [5],也有人认为高频 AI 任务没必要用最贵的模型、V4.1 Flash 够用 [8],而在电商客服工单这类结构化场景的实测中,则出现了它不如 Jev 更快更省钱、因为架构决定了后者更适配该场景的判断 [11]