DeepSeek开源552B参数多模态MoE模型DeepSeek-V4.1-Flash
DeepSeek-V4.1-Flash:突破KV缓存压缩极限
技术报告
引言
我们推出DeepSeek-V4.1-Flash,一个多模态混合专家(MoE)模型,拥有552B主干参数,支持高达一百万token的上下文。该模型原生处理图像和文本,并以自回归方式生成文本。
架构。 DeepSeek-V4.1-Flash采用因果编码器-解码器(CED)架构:一个40层Transformer,组织为20层因果编码器后接20层解码器。借助CED,解码器的全局KV缓存从最终编码器隐藏状态投影而来,而非从每个解码器层自身的隐藏状态推导。这使得模型在预填充阶段每个token仅激活8B参数,在解码阶段激活16B参数,显著提升了输入密集型智能体工作负载的成本效率。SWA有界重放通过仅重放最近的n_win个token来重建缺失的SWA KV状态,避免了将SWA KV持久化到SSD的需求,并将持久化KV缓存占用空间减少至DeepSeek-V4-Flash的约1/8。
压缩稀疏注意力2(CSA2)。 DeepSeek-V4.1-Flash使用CSA2,为每个注意力层分配三种静态模式之一——全量、重索引或重用——以跨层共享主KV和索引器K,并重用Top-K稀疏注意力索引。在解码器中,分层稀疏索引器进一步将后续索引层限制为由第一个全量模式层构建的候选池中,使更深层索引器的成本与上下文长度无关。结合FP4主KV缓存(E2M1格式,每16个通道一个E4M3缩放因子),这些设计将全局KV缓存占用空间减少至每token 890字节——约为DeepSeek-V4-Flash的1/4。
其他架构组件包括单遍mHC(修订的残差流混合,配备高效的Mega-mHC内核)、Engram条件记忆(196B参数,通过基于token的查找进行稀疏访问)以及DSpark投机解码(半自回归草稿生成,带置信度调度的验证)。模型每个MoE层使用1个共享专家和384个路由专家,每个token激活6个路由专家。
多模态架构。 一个视觉编码器(DeepSeek-ViT,从头训练,采用2D-RoPE和3×3像素重排下采样)和一个两层MLP投影器将图像转换为视觉嵌入,从语言模型预训练开始就与文本嵌入联合处理。
预训练。 DeepSeek-V4.1-Flash在包含45T token的多模态语料库上从头训练,稀疏注意力在64K序列长度下训练,上下文在34T token时扩展至1M token。
后训练。 后训练方案遵循标准的SFT → RL → 在线策略蒸馏(OPD)范式,无算法修改。所有实质性变化均在于数据流水线:大规模自动化合成智能体任务和环境,并逐步扩展数据、任务和rollout规模。该模型支持连续可控的推理努力设置(整数1-100),在推理成本与准确性之间进行权衡。
图1. (a) DeepSeek-V4.1-Flash及对标模型在智能体基准上的表现。(b) 各代DeepSeek模型每token全局KV缓存大小(字节)。DeepSeek-V4.1-Flash相对于DeepSeek-V4-Flash和DeepSeek-V1分别实现了约4倍和437倍的缩减。
评估结果
基础模型
所有基础模型均在内部框架中以相同评估设置进行评估。得分相差0.3以内视为等效。
| 基准(指标) | # Shots | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base | DeepSeek-V4.1-Flash-Base |
|---|---|---|---|---|
| 架构 | — | MoE | MoE | MoE |
| # 主干参数 | — | 284B | 1.6T | 552B |
| # 激活参数 | — | 13B | 49B | 8B / 16B |
| 世界知识 | ||||
| AGIEval (EM) | 3–5-shot | 83.9 | 84.4 | 83.4 |
| MMLU-Pro (EM) | 5-shot | 68.3 | 73.5 | 74.1 |
| C-Eval (EM) | 5-shot | 92.1 | 93.1 | 92.1 |
| MultiLoKo (LLM-Judge) | 5-shot | 42.6 | 50.9 | 45.5 |
| SimpleQA-Verified (EM) | 25-shot | 30.1 | 55.2 | 42.3 |
| SuperGPQA (EM) | 5-shot | 46.5 | 53.9 | 53.1 |
| 语言与推理 | ||||
| BBH (EM) | 3-shot | 86.9 | 87.5 | 86.1 |
| BBEH (EM) | 1-shot | 25.4 | 29.8 | 27.2 |
| DROP (F1) | 1-shot | 88.6 | 88.7 | 87.9 |
| HellaSwag (EM) | 0-shot | 85.7 | 88.0 | 87.2 |
| 代码与数学 | ||||
| BigCodeBench (Pass@1) | 3-shot | 56.8 | 59.2 | 60.6 |
| HumanEval (Pass@1) | 0-shot | 69.5 | 76.8 | 79.4 |
| GSM8K (EM) | 8-shot | 90.8 | 92.6 | 93.0 |
| MATH (EM) | 4-shot | 57.4 | 64.5 | 61.1 |
| MGSM (EM) | 8-shot | 85.7 | 84.4 | 80.2 |
| 长上下文 | ||||
| LongBench-V2 (EM) | 1-shot | 44.7 | 51.5 | 45.2 |
| 多模态 | ||||
| MMMU-Pro (EM) | 4-shot | — | — | 56.5 |
| CVBench (EM) | 4-shot | — | — | 77.9 |
| DocVQA (LLM-Judge) | 4-shot | — | — | 95.6 |
| RefCOCO-avg (Acc@0.5) | 0-shot | — | — | 86.0 |
指令模型
DeepSeek-V4.1-Flash支持从1到100的连续可控推理努力。以下所有指令结果均使用最大努力设置(reasoning_effort=100)。评估使用temperature=1.0,top_p=0.95。
对于代码智能体基准(Terminal-Bench 2.1/3.0/4.0、DeepSWE v1.1、NL2Repo-Bench、ProgramBench),模型使用DeepSeek Harness的Minimal模式和1M token上下文窗口进行评估。为符合官方设置要求,DeepSWE v1.1使用mini-SWE harness,SEC-Bench Pro使用Claude Code harness。视觉智能体基准(Chartography、BabyVision、ZeroBench)使用Claude Code harness,上下文窗口为512k token。Agent's Last Exam和AutomationBench使用其官方脚手架。所有智能体评估使用temperature=1.0,top_p=0.95。
与前沿模型对比(最大推理努力)
| 基准(指标) | Opus-5.0 | GPT-5.6 Sol | K3 | GLM-5.3 | DS-V4-Pro | DS-V4-Flash | DS-V4.1-Flash |
|---|---|---|---|---|---|---|---|
| 推理 | |||||||
| GPQA Diamond (Pass@1) | 93.4 | 94.1 | 92.9 | 88.1 | 92.4 | 89.9 | 90.9 |
| HLE (Pass@1) | 56.3 | 44.5 | 43.5 | 42.0† | 42.7† | 37.8† | 36.8 (39.1†) |
| Codeforces (Rating) | — | — | — | — | 3348 | 3289 | 3471 |
| MathArena Apex (Pass@1) | — | — | 65.6 | — | 65.3 | 58.6 | 65.6 |
| 智能体 | |||||||
| Terminal-Bench 2.1 (Pass@1) | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 82.7 | 90.6 |
| Terminal-Bench 3.0 (Pass@1) | 43.3 | 34.4 | 17.7 | 28.3 | 11.8 | 7.6 | 30.0 |
| Terminal-Bench 4.0 (Pass@1) | 51.8 | 39.9 | 12.6 | 37.9 | 12.4 | 7.0 | 31.2 |
| DeepSWE v1.1 (Resolved) | 74.0 | 73.0 | 67.5 | 66.9 | 62.7 | 54.4 | 74.2 |
| ProgramBench (Almost@1) | 37.0 | 23.0 | 17.5 | 19.0 | 15.5 | — | 20.3 |
| NL2Repo-Bench (Score) | 75.3 | 56.8 | 58.0 | 58.0 | 61.5 | 54.2 | 64.0 |
| CyberGym (Pass@1) | — | 84.5 | 80.0 | 84.5 | 83.3 | 76.7 | 88.1 |
| SEC-Bench Pro (Pass@1) | — | 74.3 | — | — | 56.4 | 30.9 | 62.8 |
| ExploitGym (Pass@1) | 22.1 | 33.7 | — | 15.0 | 5.4 | 1.8 | 15.3 |
| HLE w/ tools (Pass@1) | 63.6 | — | 59.8 | 62.5 | 60.0 | 51.5 | 63.9 |
| AutomationBench (Pass@1) | 50.3 | 45.8 | 46.7 | 48.8 | 43.2 | 37.7 | 54.8 |
| Agent's Last Exam (Pass@1) | 28.6 | 26.7 | 27.6 | 28.5 | 25.7 | 25.2 | 31.8 |
| Chartography w/ tools (Pass@1) | 84.0 | 79.9 | 68.1 | — | — | — | 78.9 |
| BabyVision w/ tools (Pass@1) | 94.1 | 88.9 | 85.7 | — | — | — | 89.6 |
| ZeroBench-main w/ tools (Pass@5) | 52.0 | 53.0 | 41.0 | — | — | — | 49.0 |
† HLE的纯文本子集。
跨智能体脚手架性能(DeepSWE v1.1和Terminal-Bench 2.1,最大推理努力)
所有脚手架在DeepSWE v1.1上每个任务使用N=8个样本,在Terminal-Bench 2.1上使用N=3,使用Linux容器,temperature=1.0,top_p=0.95,1M token上下文限制,每个智能体max_steps=500。Terminal-Bench 2.1在无网络访问条件下评估。
| 基准(指标) | Claude Code | Codex | OpenCode | Pi | mini-SWE | DSH Minimal | DSH Standard | DSH PTC |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 (Resolved) | 69.8 | 65.6 | 65.5 | 66.2 | 74.2 | 72.6 | 70.5 | 67.6 |
| Terminal-Bench 2.1 (Pass@1) | 88.0 | 84.1 | 85.0 | 86.1 | 90.3 | 90.6 | 85.8 | 85.8 |
提示编码
本次发布不包含Jinja格式的聊天模板。encoding文件夹包含一个自包含的Python参考实现(encoding.py),附带多轮对话、工具调用、思考模式、数值推理努力、对话中系统消息和交错图像内容的测试用例。
对于生产使用,我们额外发布deepseek-recipe,一组带Python绑定的Rust库,以维护的、协议感知的工具包形式提供相同的提示格式。它将Messages、Chat Completions和Responses API请求转换为Conversation格式,编码为DeepSeek V4和V4.1提示或token ID,并将模型输出解析回完整或流式响应——涵盖思考、工具调用、图像和生成设置。模型推理、工具执行和HTTP传输由调用方负责。
最小推理
请参阅inference文件夹了解权重转换和本地运行推理的说明。
推荐采样参数:
| 参数 | 值 |
|---|---|
| temperature | 1.0 |
| top_p | 0.95或1.0 |
| context_window | 1M tokens |
| max_tokens | ≥ 256K |
复现DeepSWE基准结果
evaluation文件夹包含复现DeepSWE v1.1基准结果的分步说明,涵盖dsh-minimal智能体和官方mini-swe-agent。将dsh-minimal与Pier集成所需的补丁也包含在内。
许可证
本仓库和模型权重根据MIT许可证发布。
引用
@misc{deepseekai2026deepseekv41flash,
title={DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression},
author={DeepSeek-AI},
year={2026},
}
联系方式
如有任何问题,请提交issue或通过service@deepseek.com联系我们。