NVIDIA 发布 Nemotron 3.5 Lightning:3B 活跃参数就能跑 1M 上下文,单卡 Agent 的新选择
8 月 11 日,NVIDIA 发布了 Nemotron 3.5 Lightning 30B A3B NVFP4。名字里几个关键信息:Lightning(快)、30B(总参数)、A3B(3B 活跃参数)、NVFP4(自家 4 位浮点量化)。
这不是一个用来刷榜的模型,定位是「主力干活型」,专门面向 Agent 工作流——长运行自主 Agent、子 Agent 部署,以及本地硬件上的高效推理。
架构:MoE + Mamba-2 混血
30B 总参数,每次推理只激活 3B。在便宜卡上跑能力不弱的模型,同时 Mamba 层对长上下文有帮助。
官方验证上下文 1M tokens,默认开启。Blackwell 架构(GB200、DGX Spark GB10)原生支持 FP4;Hopper(H100/H200)和 Ampere(A100)走 W4A16 路径,量化精度略有损失但覆盖面更广。
性能:在合理的档位上
NVFP4 版和 BF16 原版差距很小:
- MMLU Pro:81.62(BF16 是 81.94)
- GPQA Diamond:75.57
- SWE-bench Verified:52.80
- HLE(纯文本):10.47
中端模型里算扎实的分数。SWE-bench 52.80 在 coding agent 场景里实际可用。模型训练用了超过 20T tokens,预训练数据截止到 2025 年 9 月,post-training 截止到 2026 年 5 月。
部署:单卡就能跑
- 1× DGX Spark(GB10):vLLM + DSpark 投机解码,验证 1M 上下文
- 1× H100:Max throughput(不开投机解码,humming 后端)或 Interactive(40+ TPS/user,DSpark)
- 1× GB200:vLLM + DSpark(num_speculative_tokens=5)
- 1× RTX 5090:NVFP4 权重,硬件 FP4 tensor core 原生支持
本地开发 Ollama 已支持,一条命令:ollama run nemotron-3.5-lightning。llama.cpp 的 GGUF 权重在 Hugging Face 上,默认约 40K 上下文,显存够可以往上调。
推理支持 thinking 开关(enable_thinking),默认开启。工具调用用 --reasoning-parser nemotron_v3 和 --tool-call-parser qwen3_coder。
投机解码:三种策略
DSpark:半自回归草稿模型,一次前向传播出整块候选 token。官方推荐默认,适合 DGX Spark 和低并发部署。
DFlash:基于轻量级 block-diffusion 的草稿生成器,单次前向传播出整块草稿。
MTP:Multi-Token Prediction,训练阶段就教模型一次预测多个未来 token,不需要额外草稿模型。
H100 追求最大吞吐的批量场景,官方建议关掉投机解码——kv-cache 内存限制下 Mamba cache 需要用 FP16。
训练数据:合成数据占大头
从 Pre-training 到 Post-training,teacher models 包括 DeepSeek-V3、Qwen3-235B、GPT-OSS-120B、phi-4、Mixtral-8x22B 等多个模型。数学、代码、科学推理领域的数据大量通过蒸馏和验证管线生成,比如用 compilers、numerical checks 做自动验证。
数据过滤会去除病理重复(滑动窗口内重复 n-gram)的推理轨迹,并通过关键词/正则过滤隐式偏向特定政治实体或民族主义叙事的数据。
许可证:OpenMDW-1.1
OpenMDW License Agreement v1.1,允许商业用途。部分 pre-training 和 post-training 数据已开放,但涉及代码、数学和多语言的数据需要申请。
值得关注的点
单卡 1M 上下文仍是亮点。Mamba-2 配合 MoE 稀疏激活,3B 活跃参数在推理效率上有实质提升。之前用 Claude 或 GPT-4 处理长文档的,可以在本地机器上试试这个做 RAG 或 Agent 子任务。
NVFP4 量化对性能影响极小,MMLU Pro 几乎无损,SWE-bench 反而略有提升(51.56 → 52.80),说明量化没有带来明显能力损失。
DSpark 投机解码在 DGX Spark 上验证过 1M 上下文,想在自己机器上跑长上下文 Agent 的开发者可以关注。
模型目前主要在 NVIDIA 自家硬件上做了完整验证。非 NVIDIA 硬件(如 AMD GPU 或纯 CPU)的表现材料里未涉及。