2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

Nvidia发布开源模型Nemotron 3.5 Lightning,36亿活跃参数在速度基准上与大型闭源模型相当。

Nvidia激进的开源策略与OpenAI/Meta产品直接竞争,降低推理成本并可能使模型推理商品化。
行业媒体Slicast · 2026年8月11日 UTC 15:07 · 全球 · 来源: The Decoder
重要度 74

伟达发布了Nemotron 3.5 Lightning,这是其新Nemotron 3.5系列中的首款模型。该模型直接继承自Nemotron 3 Nano 30B A3B,保留了混合Mamba-Transformer架构,拥有31.6亿个总参数,但在任何给定时间只有3.6亿个参数处于活跃状态。这款紧凑的开源权重模型在智能基准测试中与OpenAI的gpt-oss-120b相当,但参数量仅为其四分之一,同时在同类模型中提供最快的推理速度。

根据独立基准测试平台Artificial Analysis的数据,Nemotron 3.5 Lightning在智能指数上获得24分,相比其前身(15分)提高了9个百分点。这使其与OpenAI的gpt-oss-120b(24分)相当,仅略低于英伟达自家的Nemotron 3 Super(26分),后者的规模约为其四倍。同类规模中最智能的小型模型,如Qwen3.6 35B A3B(32分)和Meta的新款Muse Glimmer(35分),仍然保持明显领先。

英伟达用Lightning瞄准的是效率前沿的不同位置。在使用最终NVFP4权重的预发布测试中,该模型达到近670个token/秒,是所有对比模型中吞吐量最高的,几乎是Google Gemini 3.5 Flash-Lite(386 token/秒)的两倍。智能指数任务完成需要约0.5分钟,而Qwen3.6 35B A3B需要约3.5分钟,Gemma 4 31B则需要约5.8分钟。专有模型仍然主宰整体效率前沿:Gemini 3.5 Flash-Lite在智能指数上获得37分且任务耗时相似,GPT-5.6 Luna(max)在不到两分钟内达到52分。

最大的改进体现在代理基准测试中。在GDPval-AA v2上,Lightning达到824的Elo评级,相比Nemotron 3 Nano提高了334分。这超过了gpt-oss-120b(800分)和更大的Nemotron 3 Super(698分)。在Terminal-Bench v2.1上,得分从7%跳升至24.3%,几乎接近gpt-oss-120b的26.2%。

英伟达在permissive OpenMDW-1.1许可证下发布该模型,将其定位为基于代理的管道的高吞吐量主力。英伟达与CodeRabbit和Harvey等合作伙伴合作进行后训练,以提升特定领域的性能。该模型提供BF16和NVFP4两种权重版本。相比更高精度的版本,NVFP4变体在智能指数上获得24分,质量损失最小。推理模型仅处理文本,支持一百万token的上下文窗口。权重现已可用,无服务器推理由DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius和Crusoe等多家公司提供。

英伟达强调效率胜于规模的做法并非新颖之举。在去年广泛讨论的一篇论文中,其研究人员主张不到100亿参数的模型能够以十分之一到三十分之一的成本处理与700亿到1750亿参数模型相同的大多数代理工作负载。Nemotron 3.5 Lightning拥有31.6亿参数,但每步仅激活3.6亿个参数,将其置于同一轻量级类别中。在近670 token/秒的速度下,它在代理基准测试上也超越了gpt-oss-120b和更大的Nemotron 3 Super,成为迄今为止该论点最清晰的产品级证明。

阅读原文
Nvidia发布开源模型Nemotron 3.5… · Slicast