DeepSeek近期发布了V4系列模型,包括V4-Flash和V4-Pro,开源且性能强劲。V4-Flash正式版已上线,在标准推理基准上击败了GPT-5.2和Gemini 3.0-Pro,仅落后于GPT-5.4和Gemini 3.1-Pro,实际落后封闭前沿大约3到6个月[2]。与此同时,DeepSeek开打了AI大模型价格战,V4 Flash定价每百万token仅0.28美元,而OpenAI GPT-5.6 Luna降价后仍需0.6美元[13]。
V4系列在技术上采用了全新的混合注意力架构,用压缩稀疏注意力(CSA)和重度压缩注意力(HCA)取代了单一的注意力堆栈,使模型能在1M token规模下保持可行性[2]。针对万亿参数规模的训练稳定性,团队引入了预期路由和SwiGLU裁剪两项技术,显著减少了损失尖峰[2]。后训练阶段则采用领域专家模式,为每个领域训练独立的专家模型,再合并到最终模型中,既恢复了专业能力,又不破坏通用模型的稳定性[2]。
价格方面,DeepSeek V4 Flash的API定价为输入每百万token 0.14美元(cache miss),输出每百万token 0.28美元[18]。V4 Flash原生支持Responses API格式,完全适配Codex,调用开发者可直接使用新版能力[4]。更早的V4 Pro FREE方案则通过Freebuff终端工具免费提供给用户,但会以看广告作为代价[15]。这种极低的定价让普通用户能以很低成本用上性能不错的大模型[9]。
围绕DeepSeek的应用生态已经非常丰富。专为DeepSeek优化的开源编程AI工具,具有费用可见、密钥默认存在本地、支持切换其他大模型、完全开源可自由修改等特点[1]。开发者实测发现DeepSeek V4与Kimi Code各有优劣[8],v4 Flash还能配合Claude Code直接在Ollama云端调用[10]。在翻译场景中,通过明确输出规则的提示词,可以打破机器翻译的生硬感,保持术语一致和风格统一[3]。体制内公文写作也有专门的提示词模板,结合上传上下文文件,能有效提升文书效率[16]。用户还可以让DeepSeek生成代码,在Colab中免费执行数据绘图,迭代优化非常方便[18]。
DeepSeek的底层技术也被其他团队借鉴。快手开源的Keye-VL-2.0模型,就是嫁接了DeepSeek的稀疏注意力机制,实现了用3B激活参数无损处理1小时视频[19]。硬件层面,DeepSeek已优化可在华为芯片上运行,并获得中国集成电路产业投资基金领投,首轮融资估值飙升至45亿美元[6]。同时,DeepSeek也在自研推理芯片[14]。
在开源社区中,DeepSeek的排名已经超过OpenAI,v4 Flash在前端基准排名第七,性能超过Open 4.8,与GLM-5.2持平,可能成为智能体工作流的新选择[11]。市场分析指出,DeepSeek R1曾引发市场对训练资本支出结束的恐慌,但真正的成本在于推理的边际成本,而DeepSeek的低价策略正在推动AI利润率崩塌的来临[17]。用户实测也显示,V4 Flash速度快价格低,支持100万token上下文,但在复杂编程生成上仍需谨慎[12]。