Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

NVIDIA의 Blackwell 플랫폼이 MLPerf Training 6.0 벤치마크 전 분야 석권, 신규 GB300은 1.6배 빠른[...]

NVIDIA 공식 — 로드맵/제품의 일차 자료 확인
공식 공시Slicast · 2026년 6월 16일 15:00 UTC · 미국 · 출처: NVIDIA Blog

NVIDIA는 AI 훈련 성능을 위한 최신 동료 심사 업계 벤치마크인 MLPerf Training 6.0에서 지배적인 결과를 발표했습니다. NVIDIA Blackwell 플랫폼은 모든 카테고리에서 선도했으며 모든 7개 벤치마크에 제출된 유일한 플랫폼이었고, 각 벤치마크에서 가장 빠른 훈련 시간을 기록했습니다.

벤치마크 라운드는 MoE 아키텍처의 증가하는 중요성을 반영하는 두 개의 새로운 mixture-of-experts 사전 훈련 워크로드를 도입했습니다: DeepSeek-V3 671B 및 GPT-OSS-20B. 대규모 MoE 훈련은 토큰을 GPU들 간에 올바른 전문가 서브네트워크로 라우팅하기 위한 all-to-all 통신이 필요하며, NVIDIA는 NVLink의 대역폭 장점을 통해 이 문제를 해결했습니다.

NVIDIA는 5세대 NVLink 스위치가 72개의 GPU를 통합 컴퓨팅 및 메모리 풀로 연결하는 GB200 NVL72 및 GB300 NVL72 랙 규모 시스템 모두에 대한 결과를 제출했습니다. GB300 NVL72는 GB200 NVL72보다 최대 1.6배 빠른 훈련을 제공했으며, NVFP4 정밀도 훈련을 통한 더 높은 컴퓨팅 밀도, 확장된 메모리 용량 및 증가된 전력 한계로 구동되었습니다.

NVIDIA는 기록 갱신 규모를 달성했습니다: DeepSeek-V3 671B용 GB200 NVL72 시스템에 8,192개 GPU(현재까지 가장 규모가 큰 Blackwell 기반 제출), 그리고 Llama 3.1 405B에 5,120개 GPU. 회사는 또한 550-billion-parameter Nemotron 3 Ultra 모델을 사전 훈련하는 데 사용된 NVFP4 훈련 방법을 강조했습니다.

19개의 생태계 파트너가 참여했으며, Microsoft Azure, Google Cloud, CoreWeave, Dell Technologies, Fujitsu 등을 포함합니다. 고객 예제는 실제 영향을 입증했습니다: Cohere는 GB200에서 3배 빠른 훈련을 달성했고, Thinking Machines Lab은 GB300에서 2배 빠른 속도를 확인했으며, Nebius가 호스팅한 Higgsfield는 22백만 사용자를 제공하면서 훈련 시간을 30%로 단축했고 매일 6백만 개 이상의 AI 콘텐츠를 생성했습니다. Midjourney는 Blackwell 클러스터에서 v8 이미지 생성 모델을 훈련했고 향후 프로젝트를 위해 Blackwell Ultra를 확장하고 있습니다.

원문 보기
NVIDIA의 Blackwell 플랫폼이 MLPerf Training 6.0… · Slicast