DeepSeek-V4-Flash-0731正式发布:Agent能力跨越,304B模型MIT开源
DeepSeek 把 DeepSeek-V4-Flash 从预览版推进到正式版了。
这个版本在 Hugging Face 上的代号是 DeepSeek-V4-Flash-0731,模型结构跟之前的 Flash-DSpark 一致,带上了 DSpark 投机解码模块。许可证是 MIT,304B 参数,可以商用。
Agent 能力的提升幅度最大。跟预览版相比,几个 benchmark 的变化很说明问题:
Terminal Bench 2.1 从 61.8 跳到 82.7,提高 20 多个点;Cybergym 从 38.7 跳到 76.7,翻了一倍;DeepSWE 从 7.3 跳到 54.4,翻了七倍多;Toolathlon-Verified 从 49.7 到 70.3;DSBench 的两个内部测试集也有显著进步。
预览版更像一个能聊天的模型,正式版才是真的能干活。
模型支持三种 reasoning_effort 级别:low、high、max。max 级别推荐最大输出长度 384K tokens,对长任务、多步骤的 Agent 场景很关键。采样参数上,Agent 场景推荐 temperature = 1.0、top_p = 0.95。
技术报告:arxiv.org/abs/2606.19348
模型页面:huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731
部署方面,vLLM 和 SGLang 都支持。vLLM 加一个 --speculative-config 参数就能开 DSpark,SGLang 用 --speculative-algorithm DSPARK。本地部署推荐参数文档在模型的 inference 文件夹里。
官方 Chat 入口:chat.deepseek.com。
304B 参数、MIT 协议、Agent 能力显著提升,这个组合在开源模型里不算常见。对开发者来说,本地跑一个能真正干 Agent 活儿的模型,门槛在降低。