Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

AMD와 Cerebras가 초저지연 AI 추론을 위한 기술 파트너십을 발표, Helios 랙 규모 인프라와 Cerebras Wafer-Scale Engine(WSE)을 결합

Nvidia LPU 및 Groq LPX에 대한 직접 경쟁 대안을 창출하며 AMD-Cerebras의 결합된 역량으로 추론 가속기 시장을 재편성합니다.
업계 전문지Slicast · July 24, 2026 · 미국 · 출처: Quiver Quantitative
중요도 92

AMD와 Cerebras Systems는 AMD Helios 랙스케일 솔루션과 Cerebras 웨이퍼스케일 엔진을 결합한 disaggregated AI 추론 솔루션을 제공하기 위한 기술적 파트너십을 발표했습니다. Advancing AI 2026에서 공개된 이 솔루션은 고급 AI 애플리케이션에 대한 초저지연성을 제공하고 처리량과 효율성을 극적으로 향상시키기 위해 설계되었습니다. 두 컴퓨팅 엔진은 와트당 초당 토큰 수를 최대 5배까지 높일 것으로 예상됩니다.

AI 추론 워크로드는 지연 시간, 처리량, 토큰 용량, 비용 및 규모 측면에서 점점 더 다양한 요구사항을 보이고 있습니다. 대용량 워크로드는 토큰 생성을 최대화하는 것을 우선시하는 반면, 코딩, 실시간 코파일럿, 라이브 에이전트 및 에이전틱 워크플로는 더 빠른 응답 시간을 요구합니다. 이러한 다양성은 특정 워크로드 요구사항에 맞게 컴퓨팅 기술을 매칭하는 이종 인프라에 대한 수요를 촉진하고 있습니다.

AMD와 Cerebras의 솔루션은 disaggregated 추론을 통해 워크플로의 두 가지 주요 단계를 독립적으로 최적화하여 이러한 과제에 대응합니다. AMD Helios는 프롬프트와 큰 컨텍스트 윈도우를 처리하는 초고처리량을 제공합니다. Cerebras 웨이퍼스케일 엔진은 초저지연성으로 메모리 대역폭 집약적인 토큰 생성을 가속화합니다. 이러한 엔진들을 하나의 통합 워크플로우로 연결함으로써 양사는 처리량이나 규모를 희생하지 않고도 초저지연성 추론을 위한 차별화된 플랫폼을 구축하고 있습니다.

AMD Helios는 복잡한 요청을 대량으로 처리하는 데 필요한 고처리량 프롬프트 엔진, 랙 스케일 효율성 및 배포 규모를 제공합니다. Cerebras 웨이퍼스케일 엔진 기술은 실시간으로 토큰을 반환하는 데 필요한 초저지연성과 디코드 성능을 제공합니다. 이 솔루션은 데이터 센터 전반에 걸쳐 고처리량 및 균형 잡힌 추론 워크로드를 위한 기반으로서 AMD Helios를 활용하며, 특히 추론 시장의 초저지연성 세그먼트를 위해 특별히 설계되었습니다.

"AI 추론은 AI 분야에서 가장 큰 인프라 기회 중 하나로 부상하고 있으며, 그 증가하는 다양성은 더 유연한 접근 방식을 필요로 합니다."라고 AMD의 의장 겸 CEO인 Dr. Lisa Su는 말했습니다. "AMD Helios는 광범위한 추론 워크로드에 대해 리더십 성능과 규모를 제공합니다. Cerebras와 함께 우리는 해당 리더십을 가장 지연 시간에 민감한 애플리케이션으로 확장하고 실시간 에이전틱 AI를 위한 강력하고 새로운 플랫폼을 창출하고 있습니다."

"초고속 추론에 대한 수요가 전례 없는 속도로 증가하고 있습니다. Cerebras는 세계에서 가장 빠르고 초저지연성 추론을 제공합니다."라고 Cerebras의 CEO이자 공동 창립자 Andrew Feldman은 말했습니다. "AMD와의 파트너십은 이러한 성능을 더 많은 고객에게 전달할 놀라운 기회를 제공합니다."

AI가 소프트웨어 개발, 자율 에이전트, 로봇공학, 과학적 발견 등 응답 시간이 사용자 경험과 시스템 유용성에 직접적인 영향을 미치는 기타 애플리케이션으로 확대됨에 따라 빠른 토큰 생성의 중요성이 점점 더 커지고 있습니다. Cerebras는 자체 데이터 센터에 AMD Helios 시스템을 도입할 계획이며, 공동 솔루션은 2026년 하반기에 처음 Cerebras Cloud를 통해 출시될 예정입니다.

원문 보기