Qualcomm이 AI250, AI350 가속기 기반 HBC 근처 메모리 AI 아키텍처 공개, HBM 대비 6배 높은 대역폭-와트 및 온칩 SRAM 대비 200배 용량 주장.
메모리 월(memory wall)은 많은 AI 워크로드의 주요 성능 제약 요인으로 남아 있습니다. 고대역폭 메모리(HBM)가 일반적으로 사용되지만, 컴퓨팅 능력이 메모리 대역폭보다 빠르게 성장하고 있어 항상 충분한 것은 아닙니다. 수요일, Qualcomm은 메모리 월을 극복하고 특정 AI 워크로드에 대해 선형 성능 확장을 가능하게 하도록 설계된 고대역폭 컴퓨팅(HBC) 근처 메모리 아키텍처를 발표했습니다.
Qualcomm의 접근 방식은 간단합니다: 회사는 AI 가속기를 시스템온칩(SoC)에서 분리하여 LPDDR DRAM 스택 바로 아래에 배치합니다. HBC 가속기는 through-silicon via를 통해 LPDDR 스택에 연결되어, 비용이 높은 HBM 메모리나 첨단 패키징 없이도 최대 대역폭과 용량을 제공합니다. Qualcomm은 HBC가 제공하는 실제 대역폭을 공개하지 않지만, HBM 대비 6배 높은 대역폭당 전력 효율과 온칩 SRAM 대비 200배 이상의 용량을 제공한다고 주장합니다.
"우리는 AI 가속기를 XPU에서 분리하고 XPU를 DRAM 스택 바로 아래에 배치했습니다"라고 Qualcomm Data Center Business의 Executive Vice President이자 General Manager인 Tony Pialis가 말했습니다. "이는 매우 중요합니다. SRAM의 성능 이점을 스택된 메모리의 밀도와 용량으로 제공하기 때문입니다. 실질적으로 HBM과 관련된 혼잡은 사라집니다. 산업에 제공되는 가치는 낮은 전력 소비, 감소된 열 발산, 그리고 HBM 솔루션에 사용되는 비용이 높은 실리콘 인터포저의 제거입니다. 우리는 또한 표준 패키징을 사용하여 단일 컴퓨팅 장치 내에 여러 HBC 스택을 배포할 수 있으며, 이는 상당한 성능대비 비용 이점을 제공합니다."
DRAM을 로직 위에 또는 인접하게 배치하는 것은 새로운 개념이 아닙니다; 모든 주요 DRAM 제조업체는 근처 메모리 컴퓨팅 아키텍처로 실험해왔지만, 널리 채택되지는 못했습니다. 더 최근에는 fabless ASIC 설계 서비스 회사인 GUC가 DRAM-on-Logic(DoL) 기술을 제안했으며, 로직 위에 1~4개의 DRAM 레이어를 배치하여 약 5 TB/s의 메모리 대역폭을 달성합니다. 이는 비용이 높은 첨단 패키징이나 HBM3E 스택을 필요로 하지 않으면서 일부 HBM3E 서브시스템보다 높은 성능을 제공합니다.
Qualcomm이 실제 성능 수치를 공개하지 않아 GUC의 제품과 직접 비교하기는 어렵습니다. HBC와 관련한 중요한 주의 사항은 Qualcomm이 HBC 가속기가 실제로 무엇을 수행하는지 공개하지 않았다는 것입니다. 이론상 그것은 무엇이든 될 수 있습니다: transformer 특화 근처 메모리 엔진, 텐서 코어의 일반적인 배열, 또는 AI 추론 또는 학습을 위한 전처리 로직.
Qualcomm의 HBC 로드맵은 다음 마일스톤을 포함합니다: AI200 가속기는 올해 말 출시될 예정이며, LPDDR5X를 사용하고 랙당 43 TB의 RAM을 제공합니다. 후속 제품인 AI250은 1세대 HBC를 사용하여 AI200보다 18배의 대역폭을 제공합니다. AI300은 2세대 HBC를 채용하여 AI300의 54배의 대역폭을 제공합니다.