Nvidia가 36억 개의 활성 파라미터를 가진 오픈소스 모델 Nemotron 3.5 Lightning을 공개했으며, 속도 벤치마크에서 더 규모가 큰 폐쇄형 모델들과 동등한 성능을 제공합니다.
Nvidia가 새로운 Nemotron 3.5 라인업의 첫 모델인 Nemotron 3.5 Lightning을 출시했습니다. 이 모델은 Nemotron 3 Nano 30B A3B의 직접적인 후속 모델이며 하이브리드 Mamba-Transformer 아키텍처를 유지하고 있으며, 총 31.6억 개의 파라미터를 가지고 있지만 언제든지 활성화되는 것은 3.6억 개에 불과합니다. 이 컴팩트한 오픈 웨이트 모델은 파라미터의 1/4만으로 지능 벤치마크에서 OpenAI의 gpt-oss-120b와 동일한 성능을 보이면서 동시에 같은 클래스에서 가장 빠른 추론 속도를 제공합니다.
독립적인 벤치마킹 플랫폼 Artificial Analysis에 따르면, Nemotron 3.5 Lightning은 Intelligence Index에서 24점을 기록했으며, 이는 이전 모델(15점)보다 9점 향상된 것입니다. 이는 OpenAI의 gpt-oss-120b(24점)와 동등하며 Nvidia의 자체 Nemotron 3 Super(26점)보다 약간 뒤떨어져 있으며, Nemotron 3 Super는 약 4배 더 큽니다. Qwen3.6 35B A3B(32점)와 Meta의 새로운 Muse Glimmer(35점) 같은 같은 크기 클래스의 가장 똑똑한 소형 모델들은 여전히 명확한 우위를 유지하고 있습니다.
Nvidia은 Lightning을 통해 효율성 경계에서 다른 위치를 목표로 삼고 있습니다. 최종 NVFP4 가중치를 사용한 사전 공개 테스트에서 이 모델은 초당 거의 670개의 토큰에 도달하여, 모든 비교 모델 중 가장 높은 처리량을 달성했으며 Google의 Gemini 3.5 Flash-Lite(초당 386토큰)보다 거의 2배 빠릅니다. Intelligence Index의 작업은 약 0.5분 만에 완료되는 반면, Qwen3.6 35B A3B는 약 3.5분이 필요하고 Gemma 4 31B는 대략 5.8분이 걸립니다. 독점 모델들은 여전히 전체 효율성 경계를 지배하고 있습니다: Gemini 3.5 Flash-Lite는 Intelligence Index에서 37점을 기록했으며 작업당 유사한 시간이 소요되고, GPT-5.6 Luna(max)는 2분 이내에 52점에 도달합니다.
가장 큰 개선은 에이전트 벤치마크에서 나타납니다. GDPval-AA v2에서 Lightning은 Elo 레이팅 824를 달성했으며, 이는 Nemotron 3 Nano보다 334점 향상된 것입니다. 이는 gpt-oss-120b(800)와 더 큰 Nemotron 3 Super(698) 모두를 능가합니다. Terminal-Bench v2.1에서 점수는 7%에서 24.3%로 상승했으며, gpt-oss-120b의 26.2%에 거의 근접합니다.
Nvidia은 이 모델을 허용적인 OpenMDW-1.1 라이선스 하에 배포하며, 에이전트 기반 파이프라인을 위한 고처리량 워크호스로 포지셔닝하고 있습니다. Nvidia는 CodeRabbit 및 Harvey와 같은 파트너들과 함께 특정 도메인에서의 성능을 향상시키기 위해 사후학습 과정에서 협업했습니다. 이 모델은 BF16 및 NVFP4 가중치 모두로 제공됩니다. NVFP4 변형은 높은 정밀도 버전에 비해 최소한의 품질 손실로 Intelligence Index에서 24점을 기록합니다. 이 추론 모델은 텍스트만 처리하며 백만 개의 토큰의 컨텍스트 윈도우를 지원합니다. 가중치는 이미 사용 가능하며, DeepInfra, Fireworks, FriendliAI, CoreWeave, GMI Cloud, Nebius 및 Crusoe을 포함한 여러 곳에서 서버리스 추론을 제공합니다.
Nvidia의 크기보다 효율성을 추구하는 노력은 새로운 것이 아닙니다. 작년에 널리 논의된 논문에서 그 연구자들은 100억 개 미만의 파라미터를 가진 모델들이 1/10에서 1/30의 비용으로 70억에서 1,750억 개 파라미터를 가진 모델들만큼 대부분의 에이전트 워크로드를 처리할 수 있다고 주장했습니다. Nemotron 3.5 Lightning은 31.6억 개의 파라미터를 가지고 있지만 단계별로 3.6억 개만 활성화하여 동일한 경량급에 속합니다. 초당 거의 670개의 토큰으로 에이전트 벤치마크에서 gpt-oss-120b와 더 큰 Nemotron 3 Super도 능가하며, 이는 그 논제에 대한 지금까지 가장 명확한 제품 수준의 증거입니다.