快速了解本文
NVIDIA 发布开源模型 Nemotron 3.5 Lightning,采用 MoE 架构,总参数 31.6B、激活参数 3.6B,推理速度最高达 670 tokens/秒。
配套开源路由库 NeMo Switchyard 可将智能体任务成本降至 Opus 4.8 单独运行的近三分之一。
模型支持 1M token 上下文,提供 BF16 与 NVFP4 格式,可在 RTX PC、DGX Spark、Jetson 及单张 H100 上运行。
本摘要由 AI 辅助整理,请以正文内容为准。
数智朋克讯 NVIDIA 于 2026 年 8 月 11 日发布开源模型 Nemotron 3.5 Lightning,同步推出开源模型路由库 NeMo Switchyard。该组合方案可将智能体任务成本降至 Opus 4.8 单独运行的近三分之一。
关键数据
Nemotron 3.5 Lightning 由 Nemotron 3 Ultra 蒸馏而来,采用混合专家(MoE)架构,总参数量 31.6B,每次推理仅激活 3.6B 参数。在 DeepInfra 端点使用 NVFP4 权重的测试中,该模型输出速度最高达 670 tokens/秒,相比同类开源模型提升约 4 倍。在 Artificial Analysis 智能指数上,Nemotron 3.5 Lightning 得分 24 分,较前代 Nemotron 3 Nano 提升 9 分,与 OpenAI gpt-oss-120b 持平。在 PinchBench 测试中,该模型准确率达 86%,跑 1 万个任务比准确率相近的 Qwen3.6 35B 快 30%。
配套发布的 NeMo Switchyard 是一个支持免调优路由的开源模型路由库。它将智能体工作负载拆分为两层:复杂规划任务交给大模型处理,高频重复的执行任务则路由给 Nemotron 3.5 Lightning 这类低成本模型。据 NVIDIA 披露,这一分工方案可将任务成本降至 Opus 4.8 单独运行的近三分之一。
Nemotron 3.5 Lightning 支持 1M token 上下文窗口,适用于长时运行的智能体场景。模型权重已上架 HuggingFace 与 OpenRouter,提供 BF16 与 NVFP4 两种格式,可在 RTX PC、DGX Spark、Jetson 及单张 H100 上运行,覆盖本地与边缘部署需求。该模型采用 OpenMDW-1.1 商用许可,允许企业自由使用与微调。







粤公网安备44030002001270号