AI Pulse
📡 X 信号

DeepSeek V4 Flash正式版发布:性价比凸显推动智能平权

等了好久,DeepSeek V4的正式版终于来了。

可惜,来的还是DeepSeek-V4-Flash,V4 Pro正式版还得继续等。但我看到消息的第一反应,还有很开心的。因为V4 Flash对我现在的生活,反而比V4 Pro还要重要。

这次,DeepSeek V4 Flash它的模型结构和参数规模完全没变,只重新做了后训练,但是强了特别多。Terminal Bench 2.1从61.8涨到了82.7。DeepSWE从7.3涨到了54.4。DSBench-FullStack从37.0涨到了68.7。

官方列出的九项Agent测试里,它已经全部超过了V4 Pro Preview。同时还原生支持Responses API,专门针对Codex进行了适配。讲真,DeepSeek这次在后训练上,应该是憋了个大的。

但如果让我非常坦率地评价,DeepSeek V4 Flash在最顶级的Coding和Agent任务里,跟GPT-5.6 Sol、Claude Opus 5、Kimi K3这些最强模型,依然会有巨大的差距。复杂项目的架构设计、长时间自主执行、充满意外的多步任务,我大概率还是会优先把最强的模型挂上去。这没什么可避讳的。

但模型真正进入生产环境以后,能力上限只是一部分。还有一个经常被低估到离谱的指标:你到底用不用得起。这也是我为什么反而更期待Flash。

我自己的AIHOT,现在每天差不多要抓一万条新闻。这些新闻进来以后,要做结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并等等,还有一大堆后续判断。最后才回到真正的精选打分环节那一步。

这里面绝大多数环节,都需要AI介入。有些流程复杂到甚至需要Agent自己调用工具、检查结果、决定下一步。一万条新闻,乘上一大串处理链路,最后就是一个极其恐怖的调用量。

按照我现在的调用规模,每个月大概API的消耗量在1000多人民币,你要是换成我常用的那些顶级模型,成本至少得翻十倍以上。但DeepSeek V4 Flash就很适合干这个。智能水平在中上等,却又便宜得离谱。

WorkBuddy里也是一样。真正难到天上的任务,大家可以接K3。可绝大多数日常任务,DeepSeek V4 Flash已经完全能处理,而且单次只消耗0.06积分。

行业当然需要那些一次跑通世界级难题的顶级模型。可这个世界上更多的真实需求,是每天重复一万次、十万次、上百万次的普通任务。当智能贵得像奢侈品时,大家只能偶尔体验。当智能便宜到像水电一样时,它才会真正流进每一家公司、每一条流水线和每一个普通人的生活里。

所以我很多时候,真的挺感谢DeepSeek。这才是真正的,智能平权。

查看 X 原帖

📬 订阅 AI Pulse

每天三次更新,不错过重要信号

▲ 回到顶部