Friday, September 11, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

Hot Chips 2026에서 Oxmiq Labs는 AI 컴퓨팅 워크로드를 대상으로 High Bandwidth Fabric와 HBM을 비교한 분석 결과를 발표했습니다.

차세대 랙에서 현재 HBM 중심 아키텍처를 대체하거나 보완할 수 있는 차세대 인터커넥트 및 메모리 대안들을 부각시킵니다.
업계 전문지Slicast · August 28, 2026 · 글로벌 · 출처: ServeTheHome
중요도 60

Oxmiq Labs는 Hot Chips 2026에서 AI 컴퓨팅을 위한 HBF(High-Bandwidth Flash)를 발표하며, AI 추론을 위한 전용 용량 계층으로서의 고대역폭 플래시 메모리의 필요성을 주장하고 있습니다. 이 발표에서는 세 가지 등급에 걸친 HBF 하드웨어 사양을 다루며, 최대 사용자 대역폭은 0.384 TB/s에서 3.072 TB/s로 확장되고 UCIe 데이터 전송률은 8 GT/s에서 32 GT/s로 상승합니다. 용량은 16개 층으로 적층된 스택에서 최대 512 GiB까지 지원합니다. Oxmiq의 핵심 주장은 동등한 비용 대비 HBM보다 8배에서 16배 더 많은 용량을 HBF가 제공한다는 것입니다.

더 넓은 메모리 기술 환경 내에서 Oxmiq는 알파(alpha)와 베타(beta)를 사용하여 기술을 매핑하며, 베타는 비용을, 알파는 대역폭을 추적합니다. 이러한 프레임워크에서 HBF는 HBM의 저비용 대체재가 아닌 독특한 용량 틈새 시장을 차지합니다. 이 구별은 모델 아키텍처를 검토할 때 특히 중요합니다. 대규모 혼합 전문가(Mixture-of-Experts, MoE) 모델은 배치 크기와 초당 토큰 수 측면에서 밀집형(dense) 모델과 다른 방식으로 작동합니다. MoE 아키텍처는 작은 배치가 전체 모델을 메모리에 보유하는 하위 단계를 도입하여, 낮은 대역폭이 허용 가능하게 만듭니다.

Oxmiq는 토큰 당 비용을 중심으로 추론 경제학을 재정의하며, 진정한 지표는 메모리가 데이터를 보유하고 대역폭을 통해 공급하는 방식에 어떻게 활용되는지에 달려 있다고 주장합니다. 해당 기업은 동일한 비용 범위 내에서 세 가지 배포 구성을 평가합니다: HBM 전용 기준선, 모든 HBF 설정, 그리고 2배 HBF에 6배 HBM의 혼합입니다. 이러한 옵션들은 최고 대역폭을 확장된 용량과 교환합니다. HBM 기준선은 288 GB의 용량으로 22 TB/s의 최고 대역폭을 달성하는 반면, 모든 HBF 구성은 용량을 4 TB로 확장하면서 12.8 TB/s로 감소합니다.

72개 GPU 랙을 사용한 시뮬레이션은 이러한 트레이드오프를 구체적으로 보여줍니다. FP4로 1M 토큰 입력과 1K 토큰 출력을 가진 디코드 중심의 Kimi-K2 1T 모델을 실행할 때, Oxmiq는 HBF가 동등한 HBM 랙 대비 약 0.6배의 대역폭으로 약 14배의 용량을 제공한다고 밝혔습니다. 성능은 컨텍스트 길이에 따라 크게 달라집니다. 짧은 256x256 컨텍스트의 경우, HBF는 낮은 배치 크기에서 비용 면에서 우위를 점하지만 85퍼센트의 "사라진 용량(dead capacity)"을 남깁니다. 긴 컨텍스트 워크로드(입력 1M 토큰, 출력 1K 토큰)로 확장하면 이점이 이동합니다. 용량은 대역폭 요구 사항이 낮게 유지되는 동안에만 유리하며, 그 이상으로는 HBM이 다시 우위를 점합니다.

혼합 배포에서 HBM은 핫-엑스퍼트 캐시로 기능할 수 있습니다. 전문가의 인기는 다양한 쿼리 전반에 걸쳐 평탄화되는 경향이 있으므로, 캐싱은 주로 낮은 배치 크기나 유사한 쿼리가 그룹화될 때 수익을 가져옵니다. 예비 시뮬레이션은 랙 달러 당 토큰 수를 단일 서버 용량에 대해 그래프로 표시하며, 기가바이트 당 저렴한 달러가 토큰 당 저렴한 달러와 동일하지 않음을 보여줍니다. 이 수학적 분석은 HBF의 타당성과 최적 배포 영역의 경계를 명확히 합니다. 배치 크기에 걸쳐 동일한 트레이드오프를 매핑하면, HBM은 랙 규모에서 우위를 유지하는 반면 HBF는 노드 당 용량을 우선시하는 배포와 가장 잘 부합함을 알 수 있습니다. 단일 서버 내 대역폭과 용량 분할에 초점을 맞춘 보조 분석은 메모리를 배포 규모에 맞게 맞추는 것이 기가바이트 당 가격표만큼 중요함을 강화합니다.

HBF 구현에는 특정 소프트웨어 요구 사항이 필요합니다. 최적의 대역폭을 위해서는 64 KB 접근 청크가 필요하며, 메모리는 섭씨 85도에서 약 24시간의 전원 온 데이터 보존 기간을 가지므로 호스트 관리 라이프사이클 처리가 필요합니다. HBF는 읽기 최적화되어 있고 쓰기 제약이 있으므로 데이터 배치는 소프트웨어 주도적 과제가 됩니다. Oxmiq는 vLLM 및 SGLang과 같은 프로덕션 프레임워크부터 TensorRT-LLM 및 AWS Neuron과 같은 벤더 최적화 스택에 이르기까지 추론 엔진 생태계를 검토합니다. 해당 기업은 vLLM을 프로덕션 기본값이자 HBF 통합의 주요 초점으로 식별합니다.

Kimi-K3와 같은 모델을 분석하며 Oxmiq는 바이트의 약 93퍼센트가 총 1.45 TB에 달하는 MoE 전문가 가중치로 구성되어 있음을 지적합니다. 따라서 HBF는 MoE 전문가 풀과 KV 캐시 오프로딩에 가장 적합하며, HBM은 어텐션 가중치와 자주 액세스되는 핫 데이터를 보유합니다. vLLM 내부에서 Oxmiq는 호스트 CPU 고정 메모지를 KV 캐시와 MoE 전문가 풀을 위해 HBF로 대체하는 플러그인을 제안합니다. 네 개의 HBM 스택과 네 개의 HBF 스택을 갖춘 GPU는 총 2.2 TB의 메모리와 약 17.4 TB/s의 최고 대역폭을 달성하여 현재 오프로딩 능력을 크게 초과합니다.

Oxmiq는 DeepSeek Sparse Attention 및 Compressed Sparse Attention과 같은 희소 어텐션 모델을 낮은 대역폭, 높은 용량 워크로드와의 정렬로 인해 HBF의 강력한 후보로 식별하지만, 채택은 모델 설계에 조건부로 달려 있습니다. 해당 기업은 전문가 병렬성(expert parallelism)을 주요 사용 사례로도 강조합니다. 저렴한 HBF 용량은 광범위한 EP 샤드를 줄이고 올투올(all-to-all) 통신을 최소화합니다. 전문가를 여덟 개 GPU에 샤딩하고 레이어 간 트래픽을 감수하는 대신, 두 개의 노드가 로컬 HBF에 전문가를 저장할 수 있습니다.

Oxmiq는 HBF가 보편적인 대체재가 아니라 좁은 범위의 추론 워크로드에 맞춰진 특수 용량 도구라고 결론짓습니다. 이는 특히 대역폭 요구 사항이 낮은 곳, 즉 긴 컨텍스트 희소 KV 캐시를 가진 작은 배치로 실행되는 MoE 모델과 같이 특정 상황에서 탁월한 성과를냅니다. 이러한 신중한 관점은 많은 HBF 홍보자들의 낙관적인 서사와 대비되며, 더 균형 잡힌 프레임을 제공합니다. 궁극적으로 메모리 아키텍처를 워크로드 특성과 배포 규모에 맞게 맞추는 것이 순수한 기가바이트 당 비용 지표보다 더 중요합니다. HBF가 널리 실용적이 되기 전에 견고한 할당자(allocators)와 배치 정책이 필수적일 것입니다. 현대의 AI 네이티브 코딩 도구는 이러한 누락된 소프트웨어 구성 요소의 개발을 가속화하여 구현 부담을 덜어줄 수 있습니다.

원문 보기