Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

AMD가 Nvidia H200 대비 우수한 성능을 주장하는 Instinct MI325X AI 가속기를 발표했으며, MI350으로의 추가 향상을 계획하고 있습니다.

고성능 AI 가속기 시장에서 Nvidia H200 지배력에 대한 직접 도전이며, GPU 시장 경쟁을 심화시킵니다.
업계 전문지Slicast · 2024년 10월 11일 12:00 UTC · 글로벌 · 출처: crn.com
중요도 80

AMD는 향후 256-GB Instinct MI325X GPU가 AI 추론 작업에서 Nvidia의 141-GB H200 프로세서를 능가할 수 있다고 밝혔으며, 차세대 MI350 가속기 칩이 성능을 대폭 개선할 것이라고 약속했다. Santa Clara, Calif. 소재의 칩 설계사는 샌프란시스코에서 열리는 Advancing AI 행사에서 이러한 주장을 할 것으로 예상되었으며, 해당 행사에서 Instinct 칩, EPYC CPU, 네트워킹 칩, 오픈 소프트웨어 스택 및 데이터 센터 설계 전문성으로 AI 컴퓨팅 거대 기업 Nvidia에 대항하려는 계획을 논의할 것이다. AMD Data Center Solutions 사업부 책임자인 Forrest Norrod에 따르면, "AMD는 로드맵을 계속 실행하고 있으며, 고객들이 필요로 하는 성능과 원하는 선택지를 제공하여 AI 인프라를 대규모로 시장에 신속히 출시하고 있다." AI 모델 학습 측면에서 AMD는 MI325X가 Nvidia의 인기 있고 강력한 H100 GPU의 후속 제품인 H200과 동등하거나 약간 더 우수하다고 밝혔다.

MI325X는 지난 12월에 출시되어 AMD를 강력한 AI 가속기 칩 제공 분야에서 Nvidia의 경쟁 상대로 인정받게 한 Instinct MI300X의 후속 제품이다. Instinct MI300X가 192GB의 HBM3 고대역폭 메모리와 5.3 TB/s의 메모리 대역폭을 특징으로 하는 반면, MI300X와 동일한 CDNA 3 GPU 아키텍처를 기반으로 하는 MI325X는 256GB의 HBM3E 메모리를 갖추고 있으며 메모리 포맷 업그레이드 덕분에 6 TB/s의 메모리 대역폭에 도달할 수 있다. 처리량 측면에서 MI325X는 MI300X와 동일한 기능을 가지고 있다: 8비트 부동소수점(FP8) 성능의 경우 2.6 petaflops, 16비트 부동소수점(FP16)의 경우 1.3 petaflops. MI325X는 내년 1분기부터 Dell Technologies, Lenovo, Supermicro, Hewlett Packard Enterprise, Gigabyte, Eviden 및 기타 여러 서버 벤더의 시스템에 탑재될 예정이다. 이 출시는 Nvidia의 가속화된 칩 출시 속도를 따라잡기 위해 명시적으로 진행되는, 2년마다가 아닌 매년 Instinct 칩을 출시하려는 AMD의 새로운 전략의 일부이다.

칩 수준에서 AI 추론 성능을 H200과 비교할 때, AMD는 MI325X가 8그룹, 70억 파라미터 Mixtral 모델로 40% 더 빠른 처리량을 제공하며, 70억 파라미터 Mixtral 모델로 30% 낮은 지연시간을 제공하고, 700억 파라미터 Llama 3.1 모델로 20% 낮은 지연시간을 제공한다고 밝혔다. 8개 칩 Instinct MI325X 플랫폼은 2TB의 HBM3e 메모리, 48 TB/s의 메모리 대역폭, 20.8 petaflops의 FP8 성능 및 10.4 petaflops의 FP16 성능을 특징으로 하며, 8개의 MI325X GPU는 896 GB/s의 대역폭을 가진 AMD의 Infinity Fabric으로 연결된다. AMD에 따르면, MI325X 플랫폼은 8개의 H200 GPU를 갖추고 있으며 올해 초 출시 배송을 시작한 Nvidia의 H200 HGX 플랫폼에 비해 80% 더 높은 메모리 용량, 30% 더 큰 메모리 대역폭 및 30% 더 빠른 FP8 및 FP16 처리량을 가지고 있다. H200 HGX 플랫폼과의 추론 성능을 비교할 때, AMD는 MI325X 플랫폼이 4,050억 파라미터 Llama 3.1 모델로 40% 더 빠른 처리량을 제공하며 700억 파라미터 Llama 3.1 모델로 20% 낮은 지연시간을 제공한다고 밝혔다. 단일 GPU에서 70억 파라미터 Llama 2 모델을 학습할 때, AMD는 MI325X가 H200보다 10% 더 빠르다고 밝혔으며, 8개의 GPU에서 700억 파라미터 Llama 2 모델을 학습할 때는 MI325X 플랫폼이 H200 HGX 플랫폼과 동등하다고 밝혔다.

AMD는 차세대 Instinct MI350 가속기 칩 시리즈가 내년 하반기에 출시될 예정이라고 밝혔으며, 1.8조 파라미터 Mixture of Experts 모델을 실행하는 8-GPU MI350 플랫폼의 엔지니어링 추정치를 기반으로 MI300X에 비해 최대 35배의 추론 성능 개선을 제공할 것이라고 암시했다. AMD의 차세대 CDNA 4 아키텍처를 기반으로 하며 3나노미터 제조 공정을 사용하는 MI350 시리즈는 288GB의 HBM3e 메모리와 8 TB/s의 메모리 대역폭을 특징으로 하는 MI355X GPU를 포함할 것이다. MI350 시리즈가 새로운 4비트 및 6비트 부동소수점 포맷(FP4, FP6)을 지원하므로, MI355X는 9.2 petaflops를 달성할 수 있으며, FP8 및 FP16은 각각 4.6 petaflops 및 2.3 petaflops에 도달할 것으로 예상된다. 8개의 MI355X GPU를 탑재한 Instinct MI355X 플랫폼은 2.3TB의 HBM3e 메모리, 64 TB/s의 메모리 대역폭, 18.5 petaflops의 FP16 성능, 37 petaflops의 FP8 성능 및 74 petaflops의 FP6 및 FP4 성능을 갖출 것으로 예상된다. 이 74 petaflops의 FP6 및 FP4 성능으로, MI355X 플랫폼은 MI300X 플랫폼의 FP16 성능보다 7.4배 빠를 것으로 예상되며, 50% 더 큰 메모리 용량은 단일 시스템에서 4.2조 파라미터 모델까지 지원할 수 있음을 의미하며, 이는 MI300X 플랫폼에서 가능했던 것보다 6배 더 크다. AMD가 내년 하반기에 MI355X를 선보인 후, 회사는 2026년에 차세대 CDNA 아키텍처와 함께 Instinct MI400 시리즈를 출시할 계획이다.

원문 보기
AMD가 Nvidia H200 대비 우수한 성능을 주장하는 Instinct… · Slicast