AWS가 Trainium3 및 Nvidia GB300 포함 새로운 칩 출시와 함께 AI Factories (관리형 컴퓨팅 서비스) 출시.
Amazon Web Services Inc.는 클라우드와 대규모 프라이빗 AI 영역 모두를 지배하려는 포괄적인 인공지능 인프라 솔루션을 발표했습니다. 발표 내용에는 AWS AI Factories의 출시, Trainium3 칩으로 구동되는 Amazon EC2 Trn3 UltraServers의 일반 공급 개시, 그리고 Nvidia의 최신 Blackwell 기반 GB300 NVL72 플랫폼을 갖춘 P6e-GB300 UltraServers의 도입이 포함되었습니다. 이러한 솔루션들은 주권적 온프레미스 배포, 차세대 커스텀 AI 가속기 및 AWS에서 제공하는 가장 선진적인 Nvidia Corp. GPU 인스턴스를 아우릅니다.
AWS AI Factories는 Nvidia 가속 컴퓨팅, AWS Trainium 칩, 고속 저지연 네트워킹, 에너지 효율적 인프라 및 Amazon Bedrock과 Amazon SageMaker를 포함한 핵심 AWS AI 서비스를 결합하여 고객의 기존 데이터 센터 내에 전용 풀 스택 AWS AI 인프라를 직접 제공합니다. 주로 정부와 규제 산업을 위해 구축된 이 플랫폼은 프라이빗 AWS Region과 같이 작동하여 엄격한 데이터 주권과 규제 준수를 보장하면서 컴퓨팅, 스토리지 및 AI 서비스에 안전하고 저지연으로 접근할 수 있습니다. 고객은 자신의 시설, 전력 및 네트워크 연결을 활용할 수 있으며, AWS는 배포, 운영 및 라이프사이클 관리를 담당하고, 이 솔루션은 통상적으로 수년이 걸리는 배포 일정을 단축합니다. AWS는 Grace Blackwell 및 향후 Vera Rubin GPU 아키텍처 지원, 그리고 Trainium4의 Nvidia NVLink Fusion 인터커넥트 향후 지원을 포함하여 Nvidia와의 심화되는 파트너십을 강조했습니다. Nvidia의 Hyperscale and HPC 부문 부사장 Ian Buck은 "대규모 AI는 고급 GPU와 네트워킹부터 데이터 센터의 모든 계층을 최적화하는 소프트웨어 및 서비스에 이르기까지 전 스택 접근 방식이 필요합니다. AWS와 함께, 우리는 이 모든 것을 고객의 환경에 직접 제공하고 있습니다."라고 말했습니다.
새로운 3나노미터 Trainium3 AI 칩으로 구동되는 Amazon EC2 Trn3 UltraServers는 이제 일반 공급되고 있습니다. Trn3 시스템은 단일 UltraServer에서 최대 144개의 Trainium3 칩까지 확장되어 Trainium2 대비 최대 4.4배 높은 컴퓨팅 성능, 4배 우수한 에너지 효율성 및 거의 4배 더 많은 메모리 대역폭을 제공합니다. UltraServers는 에이전틱 AI, 혼합 전문가 모델 및 대규모 강화 학습과 같은 차세대 워크로드를 위해 설계되었으며, 10마이크로초 미만의 칩 간 지연 시간을 실현하는 AWS 엔지니어링 네트워킹을 갖추고 있습니다. OpenAI Group PBC의 오픈 웨이트 모델 GPT-OSS를 사용한 테스트에서 AWS 고객들은 칩당 3배 높은 처리량과 이전 세대 대비 4배 빠른 추론 응답 시간을 달성했습니다. Anthropic PBC, Karakuri Ltd., Metagenomi Inc., Neto.ai Inc., Ricoh Company Ltd. 및 Splash Music Inc.를 포함한 고객들은 이미 훈련 및 추론 비용에서 최대 50% 감소를 보고하고 있습니다. AWS는 또한 FP4 및 FP8 성능과 메모리 대역폭에서 상당한 성능 향상을 제공할 것으로 예상되는 Trainium4를 미리 선보였습니다.
AWS는 Nvidia의 GB300 NVL72 플랫폼을 탑재한 새로운 P6e-GB300 UltraServers를 도입했으며, 이는 Amazon EC2에서 제공되는 가장 선진적인 Nvidia GPU 아키텍처입니다. 이 인스턴스들은 AWS에서 가장 높은 GPU 메모리 및 컴퓨팅 밀도를 제공하며, 프로덕션 환경의 조 단위 파라미터 AI 추론 및 고급 추론 모델을 목표로 합니다. P6e-GB300 시스템은 AWS Nitro System에서 작동하며 Amazon Elastic Kubernetes Service와 같은 서비스와 긴밀하게 통합되어 고객이 대규모 추론 워크로드를 안전하고 효율적으로 배포할 수 있습니다.