在黄仁勋宣布公开支持开源模型不到三周,英伟达就采取了实际行动。
美国当地时间8月11日,英伟达发布开源模型Nemotron 3.5 Lightning,同时推出开源模型路由库NeMo Switchyard。

Nemotron 3.5 Lightning是一款300亿参数的混合专家模型,面向长期运行的智能体,主要承担代码审查、工具调用、安全警报监控、账单问答等高频任务。NeMo Switchyard则负责模型选择,根据任务的要求,在不同模型之间进行路由。
开发者可以通过Hugging Face等平台免费下载Nemotron 3.5 Lightning,并根据自身需求部署、修改和二次开发。在遵守相关许可条款的情况下,无需另行向英伟达申请授权,也不收取模型许可费用。
英伟达称,Nemotron 3.5 Lightning输出速度最高可达同类模型的4倍,智能体任务完成速度提高30%。NeMo Switchyard内部测试显示,在保持前沿水平准确性的情况下,任务成本可以降至单独使用Opus 4.8的近三分之一。
过去几年的AI竞争围绕模型规模展开,如今智能体时代更看重模型执行具体任务的效率。Nemotron 3.5 Lightning就是英伟达针对这一需求推出的模型。
在复杂的智能体系统中,更强的推理模型可以负责任务规划,而Nemotron 3.5 Lightning负责大量重复性、执行型工作。这样可以减少大型模型调用次数,同时降低运行成本。
英伟达在其自研智能体任务评测基准PinchBench测试中验证了这一方向。
测试显示,Nemotron 3.5 Lightning在匹配Qwen 3.6-35B准确率的情况下,完成任务的速度快约30%;在相近完成时间下,它的准确率高于Gemma 4-26B。

Nemotron 3.5 Lightning 同类最快,准确率达前沿水平
不过,从通用能力来看,Nemotron 3.5 Lightning并不是当前最高水平模型。从第三方测评机构Artificial Analysis的Intelligence Index来看,Nemotron 3.5 Lightning覆盖9项评估,得分24,与gpt-oss-120b持平,低于部分更大的模型。

Nemotron 3.5 Lightning专为高频智能体任务定制
英伟达更强调这款模型在真实工作负载中的效率和可用性。目前,多家公司已经开始测试Nemotron 3.5 Lightning在具体业务中的应用。
Crowd Strike已经将Nemotron 3.5 Lightning用于网络安全,Harvey与Trajectory用于法律服务,CodeRabbit与Baseten用于代码审查,LilaSciences用于物理和生命科学任务,FastinoLabs则针对软件开发、金融和医疗保健工作负载进行定制。

企业定制的Nemotron 3.5 Lightning在专业智能体任务中准确率非常高
企业还可以继续根据自身数据调整模型。CodeRabbit的测试提供了一个案例。英伟达表示,该公司使用标准NeMoAuto模型配方训练一个周期,大约两个小时、85美元,就构建出了一个可工作的路由器智能体。
Nemotron 3.5 Lightning也支持多种部署方式,可以运行在英伟达RTX PC、DGX Spark、DGX Station和Jetson上,也可以扩展到RTX PRO工作站、数据中心和云端。
英伟达表示,该公司会在许可允许的范围内发布训练数据和技术,同时发布Nemotron-RL-Agentic-Terminal-Pivot数据集,用于进一步训练编码智能体的能力。
当企业拥有越来越多模型之后,新的问题出现了:如何选择模型?
智能体不同环节对模型要求不同:复杂任务需要更强推理,简单任务更看重速度和成本。全用大模型太贵,全用小模型又可能影响效果。
NeMo Switchyard就是针对这一问题推出的。
它是一套开源模型路由库,可以根据任务需求,在不同模型之间进行选择。开发者可以根据准确率、延迟和成本设置策略,也可以根据自己的业务调整路由逻辑。
英伟达企业生成式AI软件副总裁布里斯基表示,Switchyard可以根据智能体当前状态动态选择模型,任务启动前不会预先规定哪个模型处理哪类任务。
并且,Token成本也被纳入了选择过程。布里斯基解释称,Switchyard可以评估不同模型完成任务时可能产生的Token数量,再根据这一预测选择更合适的模型。

Switchyard通过智能路由不同模型的成本对比
英伟达公布的企业测试结果显示,LangChain在145个多轮DeepAgents任务中,只将7%的调用交给前沿模型,在准确率降低6%的情况下,成本下降74%。
Ramp在RampSWE-Bench中取得与前沿模型相当的性能,同时成本降低58%,运行时间减少33%。Cognition则在DevinDesktop中集成Switchyard,报告称平均成本比全部使用单一前沿模型低28%。
Boomi在5项路由能力测试中实现100%的领域路由准确率,并将59%的流量发送给速度快5倍的微调模型,后续轮次延迟降低21%。Classmethod的初步测试显示,在保持质量的情况下成本降低27%。
这些结果表明,未来企业使用AI,竞争重点可能从“拥有最强模型”转向“管理多个模型”。
在推出300亿参数模型和模型路由工具的同时,英伟达还在推进更大的开源模型项目Nemotron 4。
据科技媒体The Information援引知情人士消息,参与Nemotron项目的员工预计,最大的Nemotron 4模型至少拥有1万亿参数,大约是目前英伟达最大模型Nemotron 3 Ultra的两倍。
不过,Nemotron4目前仍处于开发阶段,具体规格和发布日期尚未确定,最终训练也还没有完成。参与项目的员工表示,大规模训练运行可能需要数月时间。
但从整体布局来看,英伟达关注的并不只是推出一个更大的模型。
过去几年,AI产业的核心竞争主要围绕模型本身展开。企业需要更强的基础模型、更大的训练规模,以及更高的基准测试成绩。
英伟达正在尝试建立另一套体系。这套体系不仅包括模型,还包括训练数据、评测工具、开发框架以及计算资源。
围绕Nemotron项目,英伟达正在扩大与外部企业和研究机构的合作。Reflection、Cursor、Thinking Machines和Mistral等公司参与提供训练数据、评估支持以及模型设计经验。Prime Intellect也贡献了大量模拟环境,用于提升模型训练能力。
与此同时,英伟达正在持续增加AI研发所需的计算投入。截至今年4月,公司多年期云服务承诺规模已经扩大至280亿美元,覆盖至2031年初。

英伟达未偿多年期云服务支出协议在过去一年大幅飙升
这些资源并不全部用于Nemotron训练,但显示出英伟达正在为下一阶段AI竞争提前储备基础设施。
与OpenAI、Anthropic等公司主要围绕“打造最强模型”展开竞争不同,英伟达更希望成为连接模型、工具、计算和开发者生态的平台。
从芯片供应商到AI基础设施提供者,这是英伟达正在推动的角色变化。
英伟达选择推动开源,并非简单加入大模型竞争,而是因为AI产业的竞争规则正在发生变化。
过去几年,行业关注的重点是“谁拥有最强模型”。OpenAI、Anthropic等公司不断提升前沿模型能力,竞争围绕参数规模、推理能力和基准测试成绩展开。谁能够训练出更强大的模型,往往意味着拥有更大的市场影响力。
但随着企业开始大规模部署AI,新的问题正在出现。
在实际工作中,一个AI智能体通常需要完成多个步骤,包括理解任务、调用工具、处理信息、检查结果以及执行操作。这些环节并不都需要最强大的模型。复杂推理任务可能需要前沿模型,而大量重复性的执行任务,则更适合速度更快、成本更低的小模型。
因此,未来AI竞争的重点可能从“谁拥有最强模型”,转向“谁能够让多个模型更高效地协同工作”。这也是英伟达推动开源模型和模型路由工具的原因。
7月下旬,英伟达CEO黄仁勋首次公开支持开源模型。他表示,开源模型能够帮助企业更好地掌握自己的AI未来,同时推动竞争并降低成本。
随后接受Axios采访时,他表示:“免费AI对硬件和芯片应是好事。”
对于英伟达而言,开源的核心价值并不是让Nemotron取代所有商业模型。更重要的是,让更多企业能够获得、修改和部署AI模型,从而推动更多企业进入AI开发和应用阶段。
企业使用AI越广泛,对训练、推理和部署计算资源的需求就越大。
英伟达企业生成式AI软件副总裁卡里·布里斯基(Kari Briski)表示,英伟达投资Nemotron,是因为公司相信,每家公司、每个国家都需要容易获得的前沿开源模型,以加强安全保障、推动创新,并提供长期依赖的基础。
因此,英伟达推动开源,本质上是在扩大整个AI基础设施市场。当模型不再只是少数公司的游戏,而是进入越来越多企业的业务系统,对芯片、算力和AI基础设施的需求也会随之增长。对英伟达来说,这可能比拥有一个“最强模型”更重要。
