Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

AMD의 Helios 플랫폼이 AI 데이터센터 운영 비용을 30% 절감하는 것으로 알려졌다.

차세대 아키텍처에 대한 경쟁력 있는 대안을 제공하며, 총 소유 비용(TCO) 절감을 추구하는 GPU 클라우드 및 하이퍼스케일러의 조달 전략 변화를 유도할 수 있습니다.
업계 전문지Slicast · September 3, 2026 · 미국 · 출처: Techgenyz
중요도 78

AMD는 엔터프라이즈 AI 인프라 패러다임을 개별 서버의 총소유비용(TCO)에서 랙 규모 효율성으로 전환하고 있습니다. 이 전략적 전환은 에이전트 AI를 포함한 현대적이고 복잡한 AI 워크로드가 고립된 프로세서 비교보다는 전력, 냉각, 네트워킹, 메모리 및 소프트웨어의 통합 관리를 필요로 한다는 점을 인식합니다. 2026년 9월 2일자로 게재된 “The Data Center Math Has Changed”라는 제목의 사견 리더십 게시물에서 AMD는 기업들이 통합화, 전력 가용성 및 포괄적인 TCO를 우선시함으로써 인프라 계획을 재고해야 한다고 주장합니다. 이러한 주장은 초거대 클라우드 기업과 기업들이 단순한 연산 처리량이 아닌 AI 데이터 센터의 주요 병목 현상인 전력 공급, 열 관리 및 물리적 용량에 직면함에 따라 대두되고 있습니다.

기존 인프라 계획은 일반적으로 서버 수준의 지표인 프로세서 성능, 단위 비용 및 필요 수량부터 시작됩니다. AMD는 이러한 접근 방식이 연쇄적인 인프라 비용을 간과한다고 지적합니다. 워크로드를 통합하면 물리적 공간, 전기 부하, 냉각 요구 사항 및 소켓 또는 코어에 기반한 소프트웨어 라이선스 요금이 줄어듭니다. 이러한 모델을 지원하기 위해 AMD의 5세대 EPYC 프로세서는 최대 192개의 코어와 5 GHz까지 도달하는 주파수를 갖춘 구성을 제공합니다. 곧 출시될 6세대 EPYC ‘Venice’ 시리즈는 256개 코어로 확장될 예정입니다. 구체적인 예로, AMD는 AMD EPYC 9965 프로세서를 탑재한 14대의 서버가 5~7년 된 레거시 듀얼 CPU Intel Xeon Platinum 8280 시스템 100대와 동일한 정수 성능을 달성할 수 있다고 명시합니다. 이는 동등한 성능을 유지하면서 서버 수를 86% 절감하며, 전력 소비는 69%, 3년 간의 TCO는 41%를 절감하는 모델링 결과를 낳습니다. AMD는 이러한 수치가 독립적이거나 교차 환경 검증이 아닌 내부 모델링을 나타낸다고 명확히 합니다.

산업계의 역사적인 가속기 집착은 에이전트 AI의 부상과 함께 진화했습니다. 단일 목적 추론 엔진과 달리 AI 에이전트는 추론하고, 정보를 검색하며, 데이터베이스를 쿼리하고, API를 호출하며, 도구를 실행하고, 응답을 종합해야 합니다. AMD는 이를 CPU, 가속기, 메모리 및 네트워크가 긴밀하게 협력하는 풀스택 워크로드라고 설명합니다. CPU는 이제 전통적인 데이터베이스 역할과 함께 필수적인 오케스트레이션 작업을 처리하며, GPU, FPGA 및 기타 가속기를 보완하는 이종 아키텍처 내에서 작동합니다. 결과적으로 의사결정자의 경제적 계산은 달러당 FLOPS 극대화에서 와트당 토큰, 달러당 토큰, 랙 활용도 및 전력 사용 효율(PUE) 최적화로 이동했습니다.

AMD의 이 과제에 대한 대응책은 AMD Helios 랙 규모 AI 플랫폼입니다. 최신 참조 설계는 72개의 AMD Instinct MI455X GPU, 18개의 6세대 EPYC Venice CPU 및 Pensando 네트워크 스위치를 통합하며, 모두 ROCm 소프트웨어 스택을 통해 관리됩니다. 이 아키텍처는 Open Compute Project의 Open Rack Wide, UALink 및 Ultra Ethernet Consortium 인터커넥트를 포함하여 개방형 산업 표준을 준수합니다. 메모리 아키텍처는 대규모 언어 모델의 병목 현상을 완화하기 위해 특히 강조됩니다. 각 MI455X GPU는 최대 432 GB의 HBM4 메모리를 갖추고 있으며 23.3 TB/s의 대역폭을 제공하여, 유사한 Nvidia Vera Rubin GPU보다 50% 더 많은 메모리 용량을 제공합니다. 랙 수준에서 AMD Helios는 31 TB의 메모리, 2.9 exaFLOPS의 FP4 성능, 260 TB/s의 스케일업 메모리 대역폭 및 43 TB/s의 스케일아웃 메모리 대역폭을 제공합니다. 이종 시스템의 경우, 메모리 대역폭과 용량은 종종 순수 FLOPS보다 중요하며, 이는 가속기와 CPU 간 병렬 처리 데이터 이동을 결정하기 때문입니다.

AMD는 경제성을 전략의 최전선에 배치하며, 경쟁사의 동일 구성 대비 달러당 최대 30% 더 많은 추론 토큰을 제공할 수 있다고 주장합니다. 이 수치는 Kimi K2 Thinking 벤치마크를 사용하여 Helios 설정을 Nvidia Vera Rubin NVL72와 비교한 AMD Performance Lab 테스트에서 도출되었습니다. AMD는 이것이 제3자 벤치마크가 아닌 독점 워크로드 비교라고 언급합니다. 근본적인 경제적 논리는 다음과 같은 단순화된 공식을 따릅니다: 총 AI 비용 ≈ (하드웨어 + 전기 + 냉각 + 네트워킹 + 소프트웨어 + 운영) / 생성된 유용한 토큰. 추론 중심 배포에서는 토큰당 비용이 초기 GPU 구매 가격보다 점점 더 중요한 요소가 됩니다.

AMD의 랙 규모 전략은 기업의 지속 가능성 목표와 직접적으로 일치합니다. AMD는 2030년까지 2024년 기준선 대비 AI 학습 및 추론의 랙 수준 에너지 효율을 20배 개선하는 것을 목표로 합니다. AMD는 약 2대의 2030년대 AMD 랙이 2024년에 도입된 570대의 랙과 동일한 컴퓨팅 출력을 달성할 것으로 전망하며, 사용 단계의 전력 소비를 20배, 탄소 강도를 28배 감소시킬 것으로 예상합니다. 이러한 수치는 AMD의 실리콘 및 시스템 개발 궤도에 근거한 로드맵 예측이며, 그 방법론은 에너지 효율 전문가인 Jonathan Koomey 박사에 의해 검증되었습니다. 지속 가능성 목표로 제시되지만, 이러한 지표는 랙 규모 효율성이 어떻게 근본적인 경제적 필수 조건이 되었는지 강조합니다.

Nvidia가 AI 가속기 분야에서 우위를 점하고 있음에도 불구하고, AMD는 더 넓은 인프라 스펙트럼 전반에서 경쟁하고 있습니다. AMD는 Instinct을 단독 GPU 대안으로 포지셔닝하기보다는 EPYC CPU, MI455X 가속기, Pensando 네트워킹 및 ROCm을 일관된 아키텍처로 통합합니다. 이러한 접근 방식은 이미 주요 인프라 구매자들로부터 검증받고 있습니다. AMD와 Meta는 최대 6기가와트의 AMD GPU를 아우르는 파트너십을 발표했으며, 초기 배포는 MI450 기반 커스텀 GPU, 6세대 EPYC Venice, ROCm 및 Helios를 중심으로 이루어집니다. OpenAI 또한 최대 6기가와트의 AMD GPU를 배포하기로 약속했으며, Microsoft는 Azure 전반에 AMD 인프라를 확장하고 프론티어 모델 추론을 위해 Helios를 사용할 계획입니다. 이러한 계약은 Nvidia의 즉각적인 시장 대체를 의미하지 않습니다. 대신, 이는 초거대 클라우드 기업들이 아키텍처 다양성, 공급망 회복력 및 워크로드별 인프라 경제성에 대한 수요가 증가하고 있음을 반영합니다. AMD에게 목표는 단순히 가속기를 판매하는 것을 넘어, 고객이 전체 데이터 센터 랙의 아키텍처와 측정 방식을 근본적으로 재평가하도록 설득하는 것입니다.

원문 보기