AMD Instinct MI455X 심층 분석: CDNA 5 아키텍처, 멀티-소켓 AI 서버의 차세대 핵심 기반
현대 기술 산업에서 AI와 GPU는 종종 분리할 수 없다. 이러한 초고처리량 칩은 AI 서버의 중요한 구성 요소가 되었으며, 메모리 대역폭과 밀집된 수학적 처리량을 결합한다. AI 서버가 주요 제품 범주이자 수익 동력으로 부상하면서 이러한 역할은 최근 몇 년간 더욱 심화되었다.
AMD에게 AI 붐은 변혁적이었다. Instinct 가속기 라인을 거의 10년 전 출시한 이후, AMD의 서버 GPU 사업은 소규모 판매에서 데이터센터 수익을 회사 전체 수익의 50% 이상으로 견인할 정도로 성장했다. 오늘날 Instinct GPU는 EPYC CPU와 함께 AMD의 가장 중요한 제품군으로 자리 잡았다.
성공은 개선에 대한 압력을 야기한다. AMD의 2026 Advancing AI 행사에서 GPU 사업부가 중심 무대에 올랐으며, MI455X와 이를 중심으로 구축된 새로운 Helios 랙 규모 시스템을 선보였다. MI455X는 AMD의 지금까지 가장 빠른 서버 GPU이며 CDNA 5를 도입하는데, 이는 10년 이상 동안 회사의 가장 중요한 서버 GPU 아키텍처 개혁이다. TSMC의 첨단 2nm 공정으로 구축되고 네트워킹 기능을 강조하며, AMD의 가장 야심 찬 서버 GPU 계획을 반영한다.
**MI455X와 CDNA 5**
MI455X는 AMD의 완전히 활성화된 CDNA 5 구현으로, 여러 중요한 변경 사항을 도입한다: 급진적으로 변경된 코어 아키텍처, HBM4 메모리 지원, TSMC의 첫 번째 GAAFET 공정 노드(N2/2nm).
이러한 업그레이드는 MI355X 대비 상당한 성능 향상을 제공한다. AMD는 FP4 및 FP8 정밀도에서 행렬(텐서) 성능의 4배 최대 개선을 주장하며, 이는 AI 워크로드에 가장 중요한 형식이다. 대부분의 다른 계산 형식은 처리량이 2배 증가하며, 이러한 이득은 원시 계산을 넘어 아키텍처 전반에 걸쳐 개선된 효율성으로 확장된다.
구체적으로, MI455X는 40 PFLOPS 이상의 밀집된 FP4 텐서 연산을 처리하며, FP6과 FP8의 경우 대략 절반이다. 전통적인 벡터 연산의 경우, 315 TFLOPS의 FP32(또는 FP16) 계산을 제공하며, 이는 MI355X의 약 2배이다.
트랜지스터 밀도가 이러한 이득의 대부분을 주도한다. TSMC N2를 사용하여 AMD는 320억 개의 트랜지스터를 가진 칩을 조립했으며, 이는 이전 세대 대비 72% 증가했다. 논리 밀도를 넘어 N2는 우수한 누설 제어를 제공한다.
CDNA 5는 Instinct 출범 이후 AMD의 서버 GPU 라인업에 대한 가장 큰 아키텍처 개정을 나타낸다. 새로운 아키텍처는 AMD의 RDNA 설계 철학을 차용하고 개선하며, SIMD32 기반 ALU 구성을 채택한다. AMD는 CDNA 5를 전체적으로 더 효율적이고 AI 워크로드 명령 흐름에 더 적합한 것으로 포지셔닝한다.
**메모리 및 I/O**
MI455X는 이 계산 하드웨어를 이론적 계산 이득을 능가하는 거대한 HBM4 메모리 서브시스템과 쌍을 이룬다. 칩은 12개의 HBM4 스택을 포함하며, 이는 MI355X보다 4개 더 많다. HBM4의 세대별 개선 덕분에, 이는 23.3 TB/초의 메모리 대역폭을 제공하며, MI355X의 2.9배이다. 특히, 계산 FLOP당 메모리 대역폭은 실제로 세대를 거치면서 증가하며, 이는 아키텍처 효율성을 크게 개선하는 드문 경우이다.
스택당 36GB로, MI455X는 432GB의 총 로컬 메모리를 지원하며, 이는 MI355X 용량의 1.5배이다. 다른 사양처럼 2배가 되지는 않았지만, AMD는 12개 스택을 추진했다. 현재 제한은 업계 전반에 걸친 DRAM 밀도 증가의 둔화에서 비롯된다.
I/O 대역폭은 AMD의 랙 규모 야망에 동등하게 중요하다. MI455X는 확장 패브릭을 위해 Ultra Accelerator Link(UAL)를 통해 3.6TB/초를 제공하며, UAL, PCIe 및 xGMI를 통한 추가 대역폭도 제공한다—MI355X의 총 링크 대역폭의 4배 이상이다. 이번 세대에는 데이터 이동이 계산 자체만큼 중요함이 입증되었다.
**전력 및 배포**
이러한 이득은 전력 측면에서 비용을 초래한다. MI355X는 가속기당 1400 와트에 도달했으며, AMD는 MI455X 전력 소비를 공개하지 않았지만, Helios 랙이 245 kW 이상을 소비하고 GPU가 그 수치를 지배하면서, 개별 MI455X 유닛은 각각 2 kW 이상으로 추정된다. 이 전력 범위는 네트워킹 토폴로지 제약과 결합되어 각 Helios 계산 트레이를 4개 GPU로 제한한다.