英伟达发布 Nemotron 3.5 Lightning:31.6B 参数的“闪电”开源模型,本地智能体的新引擎

摘要 :2026 年 8 月 11 日,NVIDIA 推出 Nemotron 3.5 Lightning------一款 300 亿(31.6B)参数的开放权重混合专家(MoE)模型。它只激活 3.6B 参数,却跑出了近 670 tokens/秒的推理速度,性能对标 gpt-oss-120b。本文整合英伟达官方博客、Artificial Analysis 等公开信息,带你一文看懂这款"为本地智能体而生"的模型。


一、为什么叫"Lightning(闪电)"?

答案很简单:

在智能体(Agent)场景里,模型大部分时间不是在"深思熟虑",而是在做大量重复性的执行工作------调用工具、校验结果、派发子任务。如果每一步都挂一个前沿大模型,成本和延迟都吃不消。Nemotron 3.5 Lightning 的定位,就是这套"模型系统"里那个永远在线、高并发、干脏活累活的执行层

官方数据(来自 NVIDIA 自测与 Artificial Analysis 独立评测):

  • 输出速度近 670 tokens/秒 ,同级别开源模型中最高,约为同类的 4 倍
  • 智能体任务完成时间缩短约 30%
  • 在 Artificial Analysis 智能指数(Intelligence Index)上拿到 24 分,比前代 Nemotron 3 Nano(15 分)提升 9 分。

注:速度类数据主要来自 NVIDIA 自测(基于 DeepInfra 上 NVFP4 权重的预发布端点),而智能指数来自第三方评测平台 Artificial Analysis,两者口径不同,下文会分别标注。


二、智能不缩水:和 gpt-oss-120b 同台

很多人一听"只激活 3.6B 参数",第一反应是"那不就是个小模型?"

但数据很有意思:

|----------------------------|---------|------|-------------|
| 模型 | 总参数 | 激活参数 | 智能指数(AA II) |
| Nemotron 3.5 Lightning | 31.6B | 3.6B | 24 |
| OpenAI gpt-oss-120b | 117B(约) | --- | 24 |
| Nemotron 3 Super | ~120B | --- | 26 |
| Qwen3.6 35B A3B | 35B | 3B | 32 |
| Meta Muse Glimmer | --- | --- | 35 |

Lightning 用大约 gpt-oss-120b 四分之一 的总参数量,拿到了和它相同的 24 分;只落后自家 4 倍体量的 Nemotron 3 Super 2 分。

当然也要客观说:在同尺寸"最聪明"的梯队里,Qwen3.6 35B A3B(32 分)和 Muse Glimmer(35 分)仍明显领先。Lightning 走的是效率前沿这条不同的路线------它不是要当"最聪明的小模型",而是要当"同智能水平下最快的模型"。

智能体基准上的提升最猛:

  • GDPval-AA v2:Elo 824,较 Nemotron 3 Nano 提升 334 分,反超 gpt-oss-120b(800)和更大的 Nemotron 3 Super(698);
  • Terminal-Bench v2.1:24.3%,是 Nano(7%)的 3 倍多,几乎追平 gpt-oss-120b(26.2%);
  • PinchBench:准确率 86%,跑 1 万个任务比 Qwen3.6 35B 快 30%。

三、它到底"小"在哪?MoE + 混合架构

Lightning 延续了 Nemotron 3 Nano 的 混合 Mamba-Transformer 架构,并采用 MoE(混合专家)设计:

路由器为每个 token 只激活一小部分"专家",所以虽然总参数有 31.6B,但每个 token 实际只跑 3.6B。

这就实现了"大模型的能力、小模型的算力成本"。再加上两项提速技术:

  1. 多 token 预测(Multi-token Prediction):在预训练阶段就内建,进一步压缩每任务耗时;
  1. 投机解码草稿模型:官方配套提供 DSpark(适合 DGX Spark / 低并发)和 DFlash 两套草稿模型。

精度方面,模型同时提供 BF16NVFP4 两种权重。Artificial Analysis 测得 NVFP4 版本在智能指数上同样是 24 分,几乎无损------而且同一份文件既能在数据中心跑,也能在桌面级 DGX Spark 上跑。


四、配套发布:NeMo Switchyard 路由库

单独一个模型还不够,NVIDIA 同时开源了 NeMo Switchyard ------一个面向智能体工具的模型路由库

它的思路很朴素:智能体工作流里,每一步该用哪个模型最划算?Switchyard 会自动把每一步请求路由到最合适的模型(无论是开放模型、专有模型还是 NVIDIA 自家模型),开发者无需改写应用。

实际效果:NVIDIA 内部基准显示,通过"规划层走前沿大模型、执行层下沉到 Lightning"的路由策略,在保持前沿级任务准确率的同时,把任务完成成本压到 单独使用 Claude Opus 4.8 的约三分之一。开源地址已上 GitHub。


五、本地部署:从你的 RTX PC 开始

这是我认为最值得关注的一点------它真的能跑在你自己的设备上

官方支持的运行环境:

  • 本地 / 边缘:NVIDIA RTX PCDGX SparkJetson、OEM GB10 系统;
  • 向上扩展:RTX PRO 工作站、DGX Station、GB300、数据中心与云端。

部署生态也很齐全,NVIDIA 已与 vLLM、Ollama、llama.cpp、LM Studio 合作提供本地体验,并给出 NVFP4GGUF 两种格式;Unsloth 也提供首日量化支持。

获取渠道:

  • 推理平台:DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius、Crusoe、OpenRouter 等;
  • 数据集:同步开源 Nemotron-RL-Agentic-Terminal-Pivot(用于代码智能体后训练的强化学习数据集)。

许可证:OpenMDW-1.1,开放商用、几乎无实质限制。开发者可以用自己的数据做后训练(fine-tune),让它更贴合特定任务、语气或编码规范------这也是"开放权重"相比纯 API 最大的价值。


六、怎么客观看这个新模型?

值得兴奋的地方:

  • 把"小参数、高吞吐、可本地部署"这条路走通了,是 NVIDIA"10B 以下模型就能扛住多数智能体负载"论文主张最清晰的工程化验证;
  • 开放权重 + 商用友好许可,企业和开发者可以真正"拥有"并定制模型;
  • 配套路由库把"模型系统"的工程化门槛降了下来。

需要冷静看待的地方:

  • PinchBench、提速等部分数据来自 NVIDIA 自评,完整评测脚本与 prompt 集尚未完全公开;
  • 在整体"时间-效率前沿"上,闭源模型依然领先:Gemini 3.5 Flash-Lite 智能指数 37(相近耗时),GPT-5.6 Luna(max)在 2 分钟内拿到 52 分;
  • 它本质是"执行层专用模型",不是用来替代前沿规划/推理模型的------最好放在"大模型编排 + 小模型执行"的系统里用。

总结

Nemotron 3.5 Lightning 不是又一个"参数更大"的模型,而是一次明确的价值选择:用四分之一的体量追平 gpt-oss-120b 的智能,换来近 4 倍的速度和可在本地 RTX PC 上跑的自由度。

对于正在做智能体、又头疼推理成本和延迟的团队来说,它值得第一时间试试------配合 NeMo Switchyard,很可能就是"又快又省"的那块关键拼图。

相关资源

  • NVIDIA 官方博客(中文):Nemotron 3.5 Lightning 与 NeMo Switchyard 介绍
  • 路由库:NeMo Switchyard(GitHub)
  • 第三方评测:Artificial Analysis Nemotron 3.5 Lightning 发布页

声明:本文数据整合自 NVIDIA 官方博客、Artificial Analysis、The Decoder、DataNorth 等公开来源,发布时

如果你觉得多模型 切换 、工具订阅的流程太繁琐,也可以试试我们的「胜算云」平台,一站式搞定AI创作与开发相关需求。官网:https://www.shengsuanyun.com/?from=CH_M2SUSXRR

相关推荐
美团技术团队2 小时前
KDD'26 美团学术论文精选及KDD Cup'26 DataAgents赛道冠军思路解读
人工智能
程序员cxuan2 小时前
Anthropic:session 之间可以相互通信了
人工智能·后端·程序员
GEOshijie1233 小时前
GEO服务商算法适配承诺怎么验收?48小时响应的合同化考核方案
人工智能·python
wordbaby3 小时前
大模型 API 核心概念笔记
人工智能
hrrrrxeeeee3 小时前
业务岗简历 AI 加分指南:CAIE、国考证书搭配量化案例写法
人工智能
yingyuecom3 小时前
Hi,导演:AI视频创作正在从“模型调用”走向“生产工作流”
大数据·人工智能
雨晨源码(同名B站)3 小时前
基于深度学习YoloV11农业病害虫害检测系统 智慧农业信息化综合管理平台 (附源码+lw文档+ppt)
数据库·人工智能·深度学习·yolo·信息可视化
QQ5416451213 小时前
【驿帮查件助手python开源】开源聚合查件机器人,实现 24 类驿站批量查件取代短信通知。技术方案分享
python·机器人·开源·驿站查件机器人
weixin_446260853 小时前
列表式交叉编码器微调 vs 智能体指令优化大模型重排器:医保医疗流程重排序系统性研究
人工智能
zlinear数据采集卡3 小时前
D223的SRAM硬件记录仪:外部触发与瞬态波形捕获方案
arm开发·嵌入式硬件·fpga开发·开源