AI Pulse
📡 X 信号

DeepSeek发布新版V4-Flash-0731 代码Agent能力涨7倍

我去,DeepSeek这波是真杀疯了,还是那个13B激活的便宜Flash模型,参数半毛钱没加,纯靠后训练就直接把代码Agent能力干涨7倍, 价格还是地板价, 都快摸到Opus的边了!!!

今天正式开公测的V4-Flash-0731,看完成绩单我直接傻了:
▫️ DeepSWE榜从7.3直接飙到54.4,翻了快7.5倍,之前的V4 Pro预览版才12.8,现在Flash直接把老Pro按在地上打
▫️ Cybergym从38.7干到76.7直接翻倍,Terminal Bench冲到82.7,比GLM-5.2还高1.7分
▫️ 工具调用、全栈开发、终端操作这些Agent核心场景,大部分指标都追平甚至超过了贵好几倍的中大型模型,部分硬榜已经摸到Claude Opus 4.8的尾巴

最狠的是,这次半毛钱没加参数:还是284B总参、13B激活的MoE,1M上下文窗口没变,纯靠后训练和Agent框架优化就出了这效果。

模型ID都不用改,老用户API直接自动切新版,一行代码都不用动。

开发者最爽的点全给你安排明白了:
1️⃣原生支持Responses API格式,直接适配Codex,之前接OpenAI、2️⃣Anthropic格式的代码无缝迁移,思考模式照常能用。
3️⃣价格还是那熟悉的白菜价:输入$0.14/百万token,缓存命中才$0.0028,输出$0.28/百万,跑高频Agent、批量改代码、工具调用根本不心疼。

另外提个醒:这次更的只有Flash API,V4 Pro正式版还在赶,App和网页端暂时没更;
跑分用的是官方即将开源的Harness,第三方框架跑出来可能有点差异,但这提升幅度,做执行层模型、跑自动化代码任务的,现在就可以开测了。

之前大家都觉得模型能力涨就得堆参数、烧算力,DeepSeek这波直接给行业打了个样:把后训练和Agent对齐磨到位,小激活模型照样能干旗舰的活,还卖白菜价。

我觉得这波之后,其他家的执行层模型,价格怕是又要往下掉咯
#DeepSeek #AI编程 #Agent #大模型

最狠的是价格, 输入$0.14每M token,输出$0.28。

做Agent、做SWE、做工具调用的,自己算笔账。

之前用Opus跑一遍的钱,现在能跑几十遍。

原生支持Responses API,Codex直接适配,不用改代码。

这才是最恐怖的地方, 不是又出了个更强的大模型。

是小模型靠后训练,在垂直Agent任务上已经摸到第一梯队的门了, 轻、快、便宜,还能打, 做Agent应用的,今天就该去测。

查看 X 原帖

订阅 AI Pulse

每天 09:00 · 14:30 · 19:30 更新