摘要 :2026 年 8 月 11 日,NVIDIA 推出 Nemotron 3.5 Lightning------一款 300 亿(31.6B)参数的开放权重混合专家(MoE)模型。它只激活 3.6B 参数,却跑出了近 670 tokens/秒的推理速度,性能对标 gpt-oss-120b。本文整合英伟达官方博客、Artificial Analysis 等公开信息,带你一文看懂这款"为本地智能体而生"的模型。
一、为什么叫"Lightning(闪电)"?
答案很简单:快。
在智能体(Agent)场景里,模型大部分时间不是在"深思熟虑",而是在做大量重复性的执行工作------调用工具、校验结果、派发子任务。如果每一步都挂一个前沿大模型,成本和延迟都吃不消。Nemotron 3.5 Lightning 的定位,就是这套"模型系统"里那个永远在线、高并发、干脏活累活的执行层。
官方数据(来自 NVIDIA 自测与 Artificial Analysis 独立评测):
- 输出速度近 670 tokens/秒 ,同级别开源模型中最高,约为同类的 4 倍;
- 智能体任务完成时间缩短约 30%;
- 在 Artificial Analysis 智能指数(Intelligence Index)上拿到 24 分,比前代 Nemotron 3 Nano(15 分)提升 9 分。
注:速度类数据主要来自 NVIDIA 自测(基于 DeepInfra 上 NVFP4 权重的预发布端点),而智能指数来自第三方评测平台 Artificial Analysis,两者口径不同,下文会分别标注。
二、智能不缩水:和 gpt-oss-120b 同台
很多人一听"只激活 3.6B 参数",第一反应是"那不就是个小模型?"
但数据很有意思:
|----------------------------|---------|------|-------------|
| 模型 | 总参数 | 激活参数 | 智能指数(AA II) |
| Nemotron 3.5 Lightning | 31.6B | 3.6B | 24 |
| OpenAI gpt-oss-120b | 117B(约) | --- | 24 |
| Nemotron 3 Super | ~120B | --- | 26 |
| Qwen3.6 35B A3B | 35B | 3B | 32 |
| Meta Muse Glimmer | --- | --- | 35 |
Lightning 用大约 gpt-oss-120b 四分之一 的总参数量,拿到了和它相同的 24 分;只落后自家 4 倍体量的 Nemotron 3 Super 2 分。
当然也要客观说:在同尺寸"最聪明"的梯队里,Qwen3.6 35B A3B(32 分)和 Muse Glimmer(35 分)仍明显领先。Lightning 走的是效率前沿这条不同的路线------它不是要当"最聪明的小模型",而是要当"同智能水平下最快的模型"。
智能体基准上的提升最猛:
- GDPval-AA v2:Elo 824,较 Nemotron 3 Nano 提升 334 分,反超 gpt-oss-120b(800)和更大的 Nemotron 3 Super(698);
- Terminal-Bench v2.1:24.3%,是 Nano(7%)的 3 倍多,几乎追平 gpt-oss-120b(26.2%);
- PinchBench:准确率 86%,跑 1 万个任务比 Qwen3.6 35B 快 30%。
三、它到底"小"在哪?MoE + 混合架构
Lightning 延续了 Nemotron 3 Nano 的 混合 Mamba-Transformer 架构,并采用 MoE(混合专家)设计:
路由器为每个 token 只激活一小部分"专家",所以虽然总参数有 31.6B,但每个 token 实际只跑 3.6B。
这就实现了"大模型的能力、小模型的算力成本"。再加上两项提速技术:
- 多 token 预测(Multi-token Prediction):在预训练阶段就内建,进一步压缩每任务耗时;
- 投机解码草稿模型:官方配套提供 DSpark(适合 DGX Spark / 低并发)和 DFlash 两套草稿模型。
精度方面,模型同时提供 BF16 和 NVFP4 两种权重。Artificial Analysis 测得 NVFP4 版本在智能指数上同样是 24 分,几乎无损------而且同一份文件既能在数据中心跑,也能在桌面级 DGX Spark 上跑。
四、配套发布:NeMo Switchyard 路由库
单独一个模型还不够,NVIDIA 同时开源了 NeMo Switchyard ------一个面向智能体工具的模型路由库。
它的思路很朴素:智能体工作流里,每一步该用哪个模型最划算?Switchyard 会自动把每一步请求路由到最合适的模型(无论是开放模型、专有模型还是 NVIDIA 自家模型),开发者无需改写应用。
实际效果:NVIDIA 内部基准显示,通过"规划层走前沿大模型、执行层下沉到 Lightning"的路由策略,在保持前沿级任务准确率的同时,把任务完成成本压到 单独使用 Claude Opus 4.8 的约三分之一。开源地址已上 GitHub。
五、本地部署:从你的 RTX PC 开始
这是我认为最值得关注的一点------它真的能跑在你自己的设备上。
官方支持的运行环境:
- 本地 / 边缘:NVIDIA RTX PC 、DGX Spark 、Jetson、OEM GB10 系统;
- 向上扩展:RTX PRO 工作站、DGX Station、GB300、数据中心与云端。
部署生态也很齐全,NVIDIA 已与 vLLM、Ollama、llama.cpp、LM Studio 合作提供本地体验,并给出 NVFP4 与 GGUF 两种格式;Unsloth 也提供首日量化支持。
获取渠道:
- 权重:Hugging Face、build.nvidia.com(NVIDIA NIM 微服务);
- 推理平台:DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius、Crusoe、OpenRouter 等;
- 数据集:同步开源 Nemotron-RL-Agentic-Terminal-Pivot(用于代码智能体后训练的强化学习数据集)。
许可证:OpenMDW-1.1,开放商用、几乎无实质限制。开发者可以用自己的数据做后训练(fine-tune),让它更贴合特定任务、语气或编码规范------这也是"开放权重"相比纯 API 最大的价值。
六、怎么客观看这个新模型?
值得兴奋的地方:
- 把"小参数、高吞吐、可本地部署"这条路走通了,是 NVIDIA"10B 以下模型就能扛住多数智能体负载"论文主张最清晰的工程化验证;
- 开放权重 + 商用友好许可,企业和开发者可以真正"拥有"并定制模型;
- 配套路由库把"模型系统"的工程化门槛降了下来。
需要冷静看待的地方:
- PinchBench、提速等部分数据来自 NVIDIA 自评,完整评测脚本与 prompt 集尚未完全公开;
- 在整体"时间-效率前沿"上,闭源模型依然领先:Gemini 3.5 Flash-Lite 智能指数 37(相近耗时),GPT-5.6 Luna(max)在 2 分钟内拿到 52 分;
- 它本质是"执行层专用模型",不是用来替代前沿规划/推理模型的------最好放在"大模型编排 + 小模型执行"的系统里用。
总结
Nemotron 3.5 Lightning 不是又一个"参数更大"的模型,而是一次明确的价值选择:用四分之一的体量追平 gpt-oss-120b 的智能,换来近 4 倍的速度和可在本地 RTX PC 上跑的自由度。
对于正在做智能体、又头疼推理成本和延迟的团队来说,它值得第一时间试试------配合 NeMo Switchyard,很可能就是"又快又省"的那块关键拼图。
相关资源
- NVIDIA 官方博客(中文):Nemotron 3.5 Lightning 与 NeMo Switchyard 介绍
- 模型权重:Hugging Face / build.nvidia.com
- 路由库:NeMo Switchyard(GitHub)
- 第三方评测:Artificial Analysis Nemotron 3.5 Lightning 发布页
声明:本文数据整合自 NVIDIA 官方博客、Artificial Analysis、The Decoder、DataNorth 等公开来源,发布时
如果你觉得多模型 切换 、工具订阅的流程太繁琐,也可以试试我们的「胜算云」平台,一站式搞定AI创作与开发相关需求。官网:https://www.shengsuanyun.com/?from=CH_M2SUSXRR