AI Pulse

DeepSeek新模型发布,智能体自主跑完多步任务

DeepSeek新模型发布,智能体自主跑完多步任务

DeepSeek-V4-Pro-0813 是 V4-Pro 的正式版,取代了预览版。官方说这一版智能体能力大幅增强,生产环境里的性能提升尤其明显。模型结构沿用预览版,额外加了一个代号 DSpark 的投机解码模块。

智能体能力通俗讲就是:让模型自己把多步骤任务做完。写代码、跑终端命令、修 bug,这些以前需要人一步步盯着、不断给指令。现在模型能一次跑完,不用中途接手。这一版的变化,从基准分数上能直接看到。

分数涨了多少

终端操作测试 Terminal Bench 2.1:72.1 → 87.9。软件工程测试 DeepSWE:12.8 → 62.7。NL2Repo(自然语言生成代码仓库):38.5 → 61.5。网络安全测试 Cybergym:52.7 → 83.3。自动化测试 AutomationBench:12.8 → 31.8。工具使用测试 Toolathlon-Verified:55.9 → 74.1。HLE 无工具 37.7 → 42.7,有工具 48.2 → 60.0。Agents' Last Exam:16.5 → 25.7。

两个内部测试集涨得同样明显。DSBench-FullStack 测全栈开发,41.8 → 71.1;DSBench-Hard 测困难的编码代理问题,31.1 → 67.2。

涨得最猛的是软件工程这一组。DeepSWE 涨了近 50 分,两个 DSBench 内部集涨了 30 分上下。网络安全测试 Cybergym 也涨了 30 分以上。预览版在 DeepSWE 和 AutomationBench 上只有 12.8 分,正式版是 62.7 和 31.8。DeepSeek 说整体与最强的专有模型大致持平,但没有逐项列出差距。生产环境里的提升具体落在哪些环节,也没展开。

分数是怎么测出来的

公共基准里的代码代理任务,统一用 DeepSeek Harness 的最小模式做智能体框架。推理努力开到最大,温度 1.0,top_p 0.95(两个都是控制采样随机性的参数)。换句话说,这些分数是模型全力思考状态下拿到的。

推理努力参数 reasoning_effort 现在有三档:low、high、max。low 适合简单任务,响应快;high 和 max 适合复杂任务。官方建议 high 和 max 档的最大输出长度给到 384K token。这个长度是为长时间自主工作准备的。

本地部署的采样参数建议:温度 1.0,代理场景 top_p 0.95,其他场景 top_p 1.0。

档位也直接关系到成本。同一次请求,max 消耗的计算量明显高于 low。对输出质量的影响有多大,官方没有给出量化对比。

部署方式变了

DSpark 的加速思路是典型的投机解码:先生成一段草稿,主模型一次验证,减少等待。开启方式是个 flag。vLLM 启动命令加 --speculative-config,method 设 dspark;SGLang 用 --speculative-algorithm DSPARK。草稿权重和主模型来自同一份检查点,不用单独指定草稿模型。

官方给的 vLLM 示例跑在单个 4×GB300 节点上。消费级硬件能不能跑,没说明。提速多少,看任务和硬件。

这版还有一处跟以往不同:没有附带 Jinja 格式的聊天模板。过去部署对话模型,常用 Jinja 模板把消息拼成输入格式。这次换成一个专用编码文件夹,里面是 Python 脚本和测试用例。脚本演示了两段逻辑:输入消息怎么编码成模型输入字符串;模型输出怎么解析回来。核心函数是 encode_messages 和 parse_message_from_completion_text。

直接调 API 的体验基本不变,自己部署的得按新方式接入。

许可证与支持

仓库和模型权重按 MIT 许可证授权。论文标题是《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,年份标 2026。有问题可以提 issue,或发邮件到 service@deepseek.com。

预览版到正式版,涨幅最集中的是软件工程测试。基准分不能直接换算成真实工作效率,但方向一致。这一版的重心,是让 AI 自己把一个多步骤任务从头跑到尾。论文标题里的百万 token 上下文,也指向同一件事。任务越长,模型要记住的中间状态越多。

阅读原文
📚 相关主题 开源大模型

订阅 AI Pulse

每天 08:00 · 12:30 · 18:30 · 23:50 更新