Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

NVIDIA가 새로운 Nemotron 모델과 NeMo 라우터 소프트웨어를 발표하여 오픈소스 AI 배포를 촉진하고 폐쇄형 생태계에 대한 의존성을 감소시킵니다.

Nvidia의 통합 모델-라우터 전략은 고객이 엔드투엔드 추론 파이프라인을 최적화하고 더 많은 인프라 가치를 확보할 수 있도록 한다.
업계 전문지Slicast · 2026년 8월 11일 16:07 UTC · 글로벌 · 출처: The Next Platform
중요도 66

Nvidia는 기술 확장과 전략적 파트너십을 통해 AI 생태계 전반에 걸친 영향력을 계속 확대하고 있습니다. 이 업체는 오픈 AI 모델 포트폴리오에 추가하고 있으며, 조직이 에이전틱 AI 워크플로우의 각 단계에 맞는 최적의 모델을 선택하는 데 도움이 되는 오픈소스 모델 라이브러리를 출시하고 있습니다. 이를 통해 단일 모델에 의존하거나 수동으로 옵션을 평가해야 할 필요성이 사라집니다.

모델 영역에서 Nvidia는 Nemotron 3.5 Lightning으로 Nemotron 제품군을 확장하고 있습니다. Lightning은 회사가 "systems of models" 또는 모델 앙상블로 부르는 것의 일부로 작동하도록 설계되었으며, 여기서 서로 다른 모델이 워크플로우의 각 단계를 처리합니다. 이는 mixture-of-experts (MoE) 접근 방식을 넘어서는 추상화 계층을 나타냅니다. Nvidia의 생성형 AI 부사장인 Kari Briski는 "효율적인 에이전트는 하나의 모델이 아니라 모델 시스템이 필요합니다. 에이전트 솔루션과 워크플로우는 많은 모델 호출을 수행합니다. 계획이 수립된 후에는 단계적으로, 즉 우리가 '턴'이라고 부르는 방식으로 실행됩니다. 서로 다른 단계에서는 서로 다른 수준의 지능이 필요한 많은 작업이 필요합니다"라고 설명했습니다.

Nvidia는 지난 1년 동안 세 가지 이전 Nemotron 모델을 출시했습니다. 2025년 12월에 출시된 Nemotron Nano는 실시간 AI 에이전트, 다단계 도구 호출, 고급 수학 및 코딩을 위해 설계된 고처리량의 효율적인 소형 언어 모델입니다. Nemotron 3 Super는 효율적인 에이전틱 워크플로우, 복잡한 추론 및 정확한 엔터프라이즈 도구 호출을 위해 MoE 설계로 된 1,200억 매개변수 오픈 가중치 모델입니다. 5,500억 매개변수의 추론 모델인 Nemotron 3 Ultra는 에이전트 오케스트레이션, 리포지토리 심층 코딩, 연구 및 엔터프라이즈 자동화를 포함한 다단계 워크플로우를 위해 높은 처리량의 오래 실행되는 에이전트를 처리합니다.

Lightning은 이 제품군의 기능을 결합합니다. Briski는 "Lightning은 우리 제품군의 최고를 함께 가져옵니다. Ultra의 지식을 Nano의 크기에 담았습니다"라고 설명했습니다. "Lightning은 특화된 작업의 지속적인 흐름을 처리하는 항상 켜져 있는 에이전트를 위해 구축되었습니다. 빠르고 정확하며 효율적인 고용량 AI를 위한 고성능 작업 모델로, 우리의 Super 모델과 동일한 지능 지수에서 같은 클래스의 다른 모델들보다 4배의 처리량을 제공합니다." 이 모델은 Nvidia의 Jetson, GeForce RTX, DGX Spark 및 DGX Station 시스템에서 실행될 수 있으므로 개발자는 매 작업마다 클라우드 API를 호출하지 않고도 자신의 하드웨어에서 작업을 실행할 수 있습니다.

Nvidia의 PinchBench를 통한 테스트에 따르면, 코딩, 연구 및 파일 관리와 같은 에이전틱 작업에 대해 오픈 모델을 평가합니다. Lightning은 비교 가능한 Qwen 모델보다 최대 30% 빠르고 Google DeepMind의 Gemma와 같은 모델보다 빠릅니다. 4배의 출력 속도로 인해 에이전틱 AI 작업을 완료하는 데 30% 속도 향상을 제공합니다. 조직은 NeMo 플랫폼을 통해 독점 데이터 및 도구에 대해 Lightning을 사후 학습할 수 있습니다. Nvidia는 학습 데이터와 기법을 공개하고 있으며, 코딩 에이전트 학습을 위한 오픈 데이터셋인 Nemotron-RL-Agentic-Terminal-Pivot을 출시하고 있습니다.

Lightning은 Nvidia의 hybrid Mamba transformer 아키텍처 및 다중 토큰 예측 기술을 활용합니다. 이 모델은 CodeRabbit, Harvey 및 Lila와 관련된 다양한 작업에서 다른 오픈 및 독점 모델을 능가했으며, CrowdStrike의 경우 Nemotron 3 Super와 비교하여 좋은 성능을 보였습니다.

Lightning과 함께 Nvidia는 에이전틱 워크플로우의 각 작업에 대해 최적의 모델을 선택할 수 있도록 하는 NeMo Switchyard 라우팅 라이브러리를 출시했습니다. Briski는 "최적의 모델은 워크플로우가 진화함에 따라 변합니다. 에이전트는 작업을 완료할 때 많은 상태를 가집니다. 에이전트 상태는 도구가 결과를 반환하거나, 오류가 발생하거나, 일부 작업이 루틴이 될 때 변합니다. 라우터는 품질, 레이턴시 및 비용의 균형을 계속 맞춥니다. 고정된 모델 선택은 이러한 변화에 적응할 수 없습니다"라고 언급했습니다. AI 모델 라우터는 새로운 것이 아닙니다. OpenRouter, Not Diamond 및 LiteLLM을 포함한 공급업체가 유사한 기능을 제공합니다. Microsoft는 5월에 정확도를 거의 83%까지 향상시키고 추론 비용을 84%까지 절감한다고 주장하는 Switchcraft를 공개했습니다.

Nvidia는 Switchyard를 오픈 모델 라인업과 함께 제시하여 개발자에게 통합 워크플로우 및 라우팅 기능을 제공합니다. Briski는 "Switchyard는 개발자와 플랫폼에 자신의 모델 풀, 라우팅 기준 및 정책을 정의할 수 있는 방법을 제공합니다"라고 설명했습니다. "프론티어 모델을 추론 집약적 단계로 라우팅하고 Lightning을 속도와 효율성이 중요한 실행 작업으로 라우팅합니다. 이것이 모델 시스템의 강점입니다. 워크플로우의 각 단계에 올바른 모델을 매칭하는 것입니다." 테스트에 따르면 Switchyard는 Anthropic의 Opus 4.8만 사용할 때보다 1/3의 비용으로 더 나은 정확도를 제공하며, Opus 4.8과 Lightning 및 Gemma 3을 결합할 때 성능이 향상됩니다.

모델 외에도 Nvidia는 AI 보안을 발전시키고 있습니다. OpenAI의 GPT-5.6-Sol 및 기타 미출시 프론티어 모델을 포함한 Hugging Face의 자율적 침해 보도에 따라 Nvidia는 Open Secure AI Alliance의 개발을 주도했습니다. 이 연합은 AI 위협으로부터의 보호가 모든 방어자가 적응하고 배포할 수 있는 오픈 모델과 도구에 기반해야 한다고 주장하는 30여 개 이상의 회사로 구성되어 있습니다. 연합은 현재 120명 이상의 회원을 포함하고 있으며 향상된 에이전틱 AI 사이버보안에 대한 지침을 개발하고 있습니다. Nvidia는 또한 AI 안전 및 보안 팀을 구성하고 있습니다.

AI 인프라 비용을 해결하기 위해 Nvidia는 Apollo, BlackRock, Blackstone, Brookfield, Goldman Sachs 및 KKR과 파트너십을 맺고 엔터프라이즈, 스타트업 및 정부 AI 인프라 투자를 지원하는 5천억 달러 규모의 펀드를 설립하고 있습니다. Nvidia 공동 창립자이자 최고 경영자인 Jensen Huang은 "AI에서 컴퓨팅은 수익입니다. 우리의 DSX AI 팩토리와 개발자, 고객 및 인수인으로 구성된 광범위한 생태계는 우리가 AI 인프라를 독립적으로 인수하는 세계의 선도적인 장기 자본 제공자들을 함께 모으는 이유를 보여줍니다"라고 말했습니다.

원문 보기
NVIDIA가 새로운 Nemotron 모델과 NeMo 라우터 소프트웨어를 발표하여… · Slicast