DeepSeek-V4-Pro-0813 正式放出:1.7T 参数,Agent 场景的 DSpark 推理提速

DeepSeek-V4-Pro-0813 发布

DeepSeek 放出了 DeepSeek-V4-Pro-0813,V4-Pro 系列的正式生产版本,替换掉了之前的 Preview。模型结构基于 V4-Pro(Preview),加了 DSpark 投机解码模块,官方称「在 Agent 能力和生产环境性能上有显著提升」。

1.7T 参数,支持 BF16、I64、F32、F8_E4M3、I8 多种权重格式,MIT 协议开源,Hugging Face 能直接下。

评测数据

Terminal Bench 2.1 上拿到 87.9,比 Preview 的 72.1 高出一截,和 Opus 4.8 的 85.0、Kimi K3 的 88.3 差不多。Agents' Last Exam 得 25.7,跟 Opus 4.8 持平。DeepSWE(内部代码 Agent 测试)从 12.8 直接跳到 62.7。

DeepSWE 涨得最离谱——Preview 在真实代码任务上挺吃力,正式版基本把这块短板补上了。

DSpark 投机解码

DSpark 是这次的新增组件。vLLM 里加一行就能用:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

SGLang 用户用 --speculative-algorithm DSPARK,不用单独指定 draft model path,因为 target 和 draft 权重在同一个 checkpoint 里。官方给的 vLLM 示例跑在单台 4×GB300 节点上,FP8 KV cache、block size 256、enable expert parallel,参数都列清楚了。

推理参数调整

reasoning_effort 现在有三个档位:low、high、max,控制模型回答前投入多少思考。官方建议 agentic 场景用 temperature=1.0、top_p=0.95,high 和 max 档位下最大输出长度设为 384K tokens。

模型没给 Jinja chat template,改而提供了一个 encoding 文件夹,里面有 Python 脚本做 OpenAI 兼容格式的编码解码。本地推理的 README 里也有权重转换和交互 demo 的说明。

可用版本

技术报告已挂 arxiv,编号 2606.19348。模型仓库目前是 1.7T 原始权重,还有 2 个微调版本和 3 个量化版本可选。

这次发布的核心信号很明确:DeepSeek 把 V4-Pro 从「能用」推到了「能扛生产负载」。Agent 场景评分提升最大,DSpark 的加入说明官方在推理成本上有明确的优化意图。MIT 协议允许商用,但 1.7T 的权重部署门槛依然不低——FP8 量化版本可能是大多数团队的起点。

相关链接:

  • 模型页面:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813
  • 技术报告:https://arxiv.org/abs/2606.19348
  • vLLM 部署说明:https://recipes.vllm.ai/deepseek-ai/DeepSeek-V4-Pro
  • SGLang 部署说明:https://docs.sglang.io/cookbook/autoregressive/DeepSeek/DeepSeek-V4
  • 本地推理说明:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-0813/blob/main/inference/README.md