Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

SK Hynix가 LLM 추론을 위해 커스텀 HBM에 근메모리 역양자화 아키텍처를 통합합니다.

HBM 공급업체들이 추론 비용 절감을 위해 커스텀 로직을 추가하고 있으며, 원시 대역폭 이상의 아키텍처 차별화를 도모하고 있다.
업계 전문지Slicast · 2026년 7월 13일 19:42 UTC · 미국 · 출처: Semiconductor Engineering
중요도 60

SK hynix의 연구원들이 AI 추론 가속화를 위한 새로운 접근 방식인 StreamDQ를 소개하는 기술 논문을 발표했습니다. "StreamDQ: Near-Memory Weight DeQuantization in Custom HBM for Scalable AI Inference Acceleration"라는 제목의 이 논문은 높은 처리량의 대규모 배치 LLM 추론을 위해 메모리 서브시스템에서 실시간 역양자화를 가능하게 하는 경량의 아키텍처 향상을 제안합니다.

StreamDQ 아키텍처는 혼합 정밀도 GEMM 작업에서 최대 7.08배 속도 향상과 90.23% 낮은 에너지 소비를 달성하여 상당한 성능 개선을 제공합니다. 컴퓨팅 코어가 아닌 메모리 근처에서 역양자화를 수행함으로써, 이 접근 방식은 대역폭 제약이 있는 메모리 작업이 전통적으로 처리량을 제한해 온 양자화된 LLM 추론의 핵심 병목 현상을 해결합니다.

원문 보기
SK Hynix가 LLM 추론을 위해 커스텀 HBM에 근메모리 역양자화 아키텍처를… · Slicast