英伟达发布 Nemotron 3.5 Lightning:31.6B 参数的“闪电”开源模型,本地智能体的新引擎

摘要 :2026 年 8 月 11 日,NVIDIA 推出 Nemotron 3.5 Lightning------一款 300 亿(31.6B)参数的开放权重混合专家(MoE)模型。它只激活 3.6B 参数,却跑出了近 670 tokens/秒的推理速度,性能对标 gpt-oss-120b。本文整合英伟达官方博客、Artificial Analysis 等公开信息,带你一文看懂这款"为本地智能体而生"的模型。


一、为什么叫"Lightning(闪电)"?

答案很简单:

在智能体(Agent)场景里,模型大部分时间不是在"深思熟虑",而是在做大量重复性的执行工作------调用工具、校验结果、派发子任务。如果每一步都挂一个前沿大模型,成本和延迟都吃不消。Nemotron 3.5 Lightning 的定位,就是这套"模型系统"里那个永远在线、高并发、干脏活累活的执行层

官方数据(来自 NVIDIA 自测与 Artificial Analysis 独立评测):

  • 输出速度近 670 tokens/秒 ,同级别开源模型中最高,约为同类的 4 倍
  • 智能体任务完成时间缩短约 30%
  • 在 Artificial Analysis 智能指数(Intelligence Index)上拿到 24 分,比前代 Nemotron 3 Nano(15 分)提升 9 分。

注:速度类数据主要来自 NVIDIA 自测(基于 DeepInfra 上 NVFP4 权重的预发布端点),而智能指数来自第三方评测平台 Artificial Analysis,两者口径不同,下文会分别标注。


二、智能不缩水:和 gpt-oss-120b 同台

很多人一听"只激活 3.6B 参数",第一反应是"那不就是个小模型?"

但数据很有意思:

|----------------------------|---------|------|-------------|
| 模型 | 总参数 | 激活参数 | 智能指数(AA II) |
| Nemotron 3.5 Lightning | 31.6B | 3.6B | 24 |
| OpenAI gpt-oss-120b | 117B(约) | --- | 24 |
| Nemotron 3 Super | ~120B | --- | 26 |
| Qwen3.6 35B A3B | 35B | 3B | 32 |
| Meta Muse Glimmer | --- | --- | 35 |

Lightning 用大约 gpt-oss-120b 四分之一 的总参数量,拿到了和它相同的 24 分;只落后自家 4 倍体量的 Nemotron 3 Super 2 分。

当然也要客观说:在同尺寸"最聪明"的梯队里,Qwen3.6 35B A3B(32 分)和 Muse Glimmer(35 分)仍明显领先。Lightning 走的是效率前沿这条不同的路线------它不是要当"最聪明的小模型",而是要当"同智能水平下最快的模型"。

智能体基准上的提升最猛:

  • GDPval-AA v2:Elo 824,较 Nemotron 3 Nano 提升 334 分,反超 gpt-oss-120b(800)和更大的 Nemotron 3 Super(698);
  • Terminal-Bench v2.1:24.3%,是 Nano(7%)的 3 倍多,几乎追平 gpt-oss-120b(26.2%);
  • PinchBench:准确率 86%,跑 1 万个任务比 Qwen3.6 35B 快 30%。

三、它到底"小"在哪?MoE + 混合架构

Lightning 延续了 Nemotron 3 Nano 的 混合 Mamba-Transformer 架构,并采用 MoE(混合专家)设计:

路由器为每个 token 只激活一小部分"专家",所以虽然总参数有 31.6B,但每个 token 实际只跑 3.6B。

这就实现了"大模型的能力、小模型的算力成本"。再加上两项提速技术:

  1. 多 token 预测(Multi-token Prediction):在预训练阶段就内建,进一步压缩每任务耗时;
  1. 投机解码草稿模型:官方配套提供 DSpark(适合 DGX Spark / 低并发)和 DFlash 两套草稿模型。

精度方面,模型同时提供 BF16NVFP4 两种权重。Artificial Analysis 测得 NVFP4 版本在智能指数上同样是 24 分,几乎无损------而且同一份文件既能在数据中心跑,也能在桌面级 DGX Spark 上跑。


四、配套发布:NeMo Switchyard 路由库

单独一个模型还不够,NVIDIA 同时开源了 NeMo Switchyard ------一个面向智能体工具的模型路由库

它的思路很朴素:智能体工作流里,每一步该用哪个模型最划算?Switchyard 会自动把每一步请求路由到最合适的模型(无论是开放模型、专有模型还是 NVIDIA 自家模型),开发者无需改写应用。

实际效果:NVIDIA 内部基准显示,通过"规划层走前沿大模型、执行层下沉到 Lightning"的路由策略,在保持前沿级任务准确率的同时,把任务完成成本压到 单独使用 Claude Opus 4.8 的约三分之一。开源地址已上 GitHub。


五、本地部署:从你的 RTX PC 开始

这是我认为最值得关注的一点------它真的能跑在你自己的设备上

官方支持的运行环境:

  • 本地 / 边缘:NVIDIA RTX PCDGX SparkJetson、OEM GB10 系统;
  • 向上扩展:RTX PRO 工作站、DGX Station、GB300、数据中心与云端。

部署生态也很齐全,NVIDIA 已与 vLLM、Ollama、llama.cpp、LM Studio 合作提供本地体验,并给出 NVFP4GGUF 两种格式;Unsloth 也提供首日量化支持。

获取渠道:

  • 推理平台:DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius、Crusoe、OpenRouter 等;
  • 数据集:同步开源 Nemotron-RL-Agentic-Terminal-Pivot(用于代码智能体后训练的强化学习数据集)。

许可证:OpenMDW-1.1,开放商用、几乎无实质限制。开发者可以用自己的数据做后训练(fine-tune),让它更贴合特定任务、语气或编码规范------这也是"开放权重"相比纯 API 最大的价值。


六、怎么客观看这个新模型?

值得兴奋的地方:

  • 把"小参数、高吞吐、可本地部署"这条路走通了,是 NVIDIA"10B 以下模型就能扛住多数智能体负载"论文主张最清晰的工程化验证;
  • 开放权重 + 商用友好许可,企业和开发者可以真正"拥有"并定制模型;
  • 配套路由库把"模型系统"的工程化门槛降了下来。

需要冷静看待的地方:

  • PinchBench、提速等部分数据来自 NVIDIA 自评,完整评测脚本与 prompt 集尚未完全公开;
  • 在整体"时间-效率前沿"上,闭源模型依然领先:Gemini 3.5 Flash-Lite 智能指数 37(相近耗时),GPT-5.6 Luna(max)在 2 分钟内拿到 52 分;
  • 它本质是"执行层专用模型",不是用来替代前沿规划/推理模型的------最好放在"大模型编排 + 小模型执行"的系统里用。

总结

Nemotron 3.5 Lightning 不是又一个"参数更大"的模型,而是一次明确的价值选择:用四分之一的体量追平 gpt-oss-120b 的智能,换来近 4 倍的速度和可在本地 RTX PC 上跑的自由度。

对于正在做智能体、又头疼推理成本和延迟的团队来说,它值得第一时间试试------配合 NeMo Switchyard,很可能就是"又快又省"的那块关键拼图。

相关资源

  • NVIDIA 官方博客(中文):Nemotron 3.5 Lightning 与 NeMo Switchyard 介绍
  • 路由库:NeMo Switchyard(GitHub)
  • 第三方评测:Artificial Analysis Nemotron 3.5 Lightning 发布页

声明:本文数据整合自 NVIDIA 官方博客、Artificial Analysis、The Decoder、DataNorth 等公开来源,发布时

如果你觉得多模型 切换 、工具订阅的流程太繁琐,也可以试试我们的「胜算云」平台,一站式搞定AI创作与开发相关需求。官网:https://www.shengsuanyun.com/?from=CH_M2SUSXRR

相关推荐
Dfreedom.4 分钟前
目标检测后处理核心:NMS非极大值抑制详解
图像处理·人工智能·深度学习·目标检测·目标跟踪
枫叶丹46 分钟前
实时语音 Agent:从语音机器人到连续协作界面
人工智能·chatgpt·机器人·语音识别·agent·codex
戴西软件18 分钟前
戴西iDWS.3DViz Suite数据轻量化可视化软件,从传统桌面软件向云端协同的重大突破
大数据·运维·网络·人工智能·机器学习·3d
AIkk8620 分钟前
2026年AI证件照工具功能速览:三款实用方案对比
人工智能
ReleaseU21 分钟前
Harness + MCP:打通企业工具链的最后一步
人工智能·大模型
衡石科技36 分钟前
衡石科技携手超聚变联合发布HENGSHI BOX,引领私域ChatBI规模化落地
大数据·人工智能·科技
新知图书41 分钟前
10.4 交互优化与用户体验提升
人工智能·多模态·智能体
IT_陈寒1 小时前
JavaScript数组排序踩的坑,差点让我加班到凌晨
前端·人工智能·后端
敢敢是只喵i1 小时前
一个本地 AI Agent 要操作多个门店或 SaaS 账号,应该怎样安全切换身份?
人工智能·安全·ai·系统架构·业界资讯