AI Pulse
📡 X 信号

这个新大模型只比GPT最强版差1分,价格还便宜六成

DeepSeek V4 Flash 0731 在 Artificial Analysis Intelligence Index 上取得了 50 分,比 2026 年 4 月发布的 DeepSeek V4 Flash 提升了 10 分,比 DeepSeek V4 Pro 领先 6 分。

它与早前的 DeepSeek V4 Flash 拥有相同的架构和定价,落在了我们智能 vs 单任务成本帕累托前沿上。

@deepseek_ai 的 DeepSeek V4 Flash 0731 比 GPT-5.6 Luna (max, 51) 低 1 个智能指数点。

即便在 OpenAI 今日对 GPT-5.6 Luna 降价 80% 之后,DeepSeek 官方 API 上 DeepSeek V4 Flash 0731 的单任务成本仍比智能水平相近的 GPT-5.6 Luna (max) 低约 60%。

这一优势的核心驱动因素是 DeepSeek 官方 API 提供约 98% 的缓存命中折扣,比行业大多数厂商提供的 90% 缓存命中折扣力度大得多。

新模型比上一代 DeepSeek V4 Flash(得分 40)提升显著,得分仅比 GLM-5.2 (max, 51) 低 1 分,仍比开放权重当前前沿 Kimi K3 (max, 57) 落后 7 分。

补充背景:该模型得分与新近发布的 Gemini 3.6 Flash(50)持平,比 Muse Spark 1.1 (xhigh, 51) 低 1 分。

预计 DeepSeek 将在未来几周发布该模型的全量权重。

DeepSeek V4 Flash 0731 保留了 1M token 上下文窗口,模型规模与 DeepSeek V4 Flash 保持不变:总参数 284B,推理时激活参数 13B。

核心结果:
➤ 智能体性能提升:DeepSeek V4 Flash 0731 在 GDPval-AA v2(我们针对真实世界智能体工作任务的评估)上取得了 1559 的 Elo 评分,而上一代 DeepSeek V4 Flash 为 1189。权重发布后,它将成为开放权重中得分第二高的模型,仅次于 Kimi K3 (max, 1687),高于 GLM-5.2 (max, 1510)。Terminal-Bench 2.1 提升 17 分至 79%,τ³-Bench Banking 提升 8 分至 31%

➤ Token 用量相比前代降低 12%:运行 Intelligence Index 时,DeepSeek V4 Flash 0731 使用了约 2.06 亿输出 token,而上一代 DeepSeek V4 Flash 约为 2.34 亿。新变体的 token 效率更高,能用更少的总输出 token 取得更高的 Intelligence Index 得分

➤ DeepSeek V4 Flash 0731 在 Intelligence Index 的所有评估项目上都优于前代:除智能体性能提升外,CritPt 提升 9 分至 17%,SciCode 提升 5 分至 50%,Humanity's Last Exam 提升 5 分至 37%,AA-LCR 提升 3 分至 66%,GPQA Diamond 提升 1 分至 91%

➤ AA-Omniscience 性能提升来自幻觉减少,而非准确率提升:DeepSeek V4 Flash 0731 的 AA-Omniscience Index 为 -16,比前代提升了 +7。这一提升完全来自幻觉率降低,整体准确率(正确百分比)保持不变。它的 AA-Omniscience 幻觉率为 84%,比前代降低了 12 个百分点,与 GPT-5.6 Terra (max, 85%) 和 Mistral Medium 3.5 (82%) 等模型水平相当

额外模型信

本文由 AI 翻译自英文原帖,技术名词保留英文。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部