Friday, October 2, 2026
AI 인프라 · 뉴스 & 분석
홈 › 데이터센터 › 리포트
데이터센터 · 리포트

AI 추론 워크로드가 이제 NAND 플래시 수요의 가장 큰 주도 요인으로, 데이터센터 스토리지 요구 사항이 심화되면서 처음으로 스마트폰 소비를 넘어섰다.

데이터센터 NAND로의 수요 측 변화는 AI 시스템 구축의 일환으로 저장소 인프라에 대한 지속적인 자본지출을 시사하며, 팹 용량 배분 및 저장소 공급업체 전략에 함의를 갖는다.
업계 전문지Slicast · 2026년 9월 30일 13:26 UTC · 미국 · 출처: finance.biggo.com
중요도 60

AI 추론은 낸드 플래시 산업의 수요 구조를 근본적으로 재편하고 있습니다. 2026년 데이터센터는 전체 낸드 수요의 약 45%를 차지하며, 처음으로 스마트폰을 앞질러 최대 최종 시장이 되었습니다. Kioxia는 2031년까지 데이터센터 낸드 수요가 1,686 EB에 도달할 것으로 예측하고 있으며, AI 추론 기반 수요는 AI 훈련 수요보다 5배 빠르게 증가하고 있습니다. 근본적인 원동력은 KV 캐시 오프로딩입니다. 긴 컨텍스트 추론은 상당한 "작업 메모리"를 생성하며, 이는 처음으로 낸드를 중간 계산 저장소의 필수 요소로 만들었습니다. SanDisk는 이를 "토큰 배터리"라고 부릅니다. SanDisk는 2030년까지 AI 데이터센터 낸드 출하량이 1.2 ZB에 도달할 것으로 예상하며, 스테이징, KV 캐시 오프로딩, 빠른 데이터 레이크 워크로드가 각각 40%, 35%, 25%를 차지할 것으로 보고 있습니다. 동시에 낸드 제조업체는 HBM과 일반 SSD 사이의 격차를 좁히기 위해 고대역폭 플래시(HBF)를 개발하고 있습니다. SanDisk와 SK Hynix는 표준 연합을 구성했고 파일럿 생산 라인을 구축했으며, 2027년 양산을 목표로 하고 있습니다.

AI 붐은 낸드 플래시 산업의 근본적인 경제 구조를 다시 쓰고 있습니다. 한때 과잉 공급과 가격 붕괴의 악순환에 갇힌 상품으로 취급되던 낸드는 이제 처음으로 계산의 필수 요소가 되었습니다. AI 추론 워크로드의 폭발적 성장으로 인해 계산 경로 자체의 핵심 구성 요소가 되었습니다. 2026년 데이터센터는 역사적으로 스마트폰을 넘어 낸드 수요의 최대 점유율을 차지하게 되었습니다.

Kioxia의 예측은 규모를 잘 보여줍니다. 전체 데이터센터 낸드 수요는 2025년의 286 EB에서 2031년까지 1,686 EB로 성장할 것이며, 이는 연 34%의 복합 성장률을 의미합니다. 이러한 확장 내에서 AI 추론 기반 수요는 AI 훈련 수요보다 5배 더 빠르게 증가하고 있으며, 이를 통해 이 낸드 슈퍼사이클 뒤의 지배적 힘이 됩니다.

**수요 구조의 근본적 변화**

AI 시대 이전, 낸드 산업 성장은 주로 스마트폰, PC, 소비자 전자제품의 기기별 용량 증가와 HDD를 SSD로 점진적으로 대체하는 것에 의존했습니다. 이는 안정적이고 예측 가능한 패턴이었습니다. 호황과 불황의 사이클은 주로 무질서한 용량 확장과 급작스러운 공급 축소에서 비롯되었습니다. 낸드 제조업체는 "경쟁사보다 손실을 덜 입기"를 희망할 수만 있었고, 기술적 리더십은 거의 가격 결정력으로 이어지지 않았습니다.

2026년은 전환점을 나타냅니다. 데이터센터의 낸드 수요 점유율은 2025년의 약 30%에서 약 45%로 급증했으며, 같은 기간 스마트폰은 약 23%로 축소되었습니다. 수요 드라이버가 가격에 민감한 소비자 전자제품에서 총 소유 비용(TCO)과 투자된 계산에 대한 수익률(ROI)을 기준으로 의사 결정하는 클라우드 서비스 제공자로 근본적으로 이동했습니다.

클라우드 제공자의 구매 논리가 변환되었습니다. "이번 분기 낸드 가격이 충분히 낮은가?"에서 "향후 3년 동안 우리의 GPU 인프라를 계속 운영하기 위해 일정에 맞춰 충분한 고성능 엔터프라이즈 SSD를 확보할 수 있는가?"로 변했습니다. 단기 가격 최적화에서 장기 공급 보증으로의 전환은 낸드 제조업체가 새로운 장기 비즈니스 모델을 구축할 기반을 제공합니다.

**KV 캐시 오프로딩: "토큰 배터리"로서의 낸드**

AI 추론 시대에서 가장 심오한 변화는 낸드의 새로운 역할, 즉 "중간 계산 산물" 저장입니다. 긴 컨텍스트 추론은 대규모 KV 캐시를 생성합니다. 더 이상 외부 소스에서 가져온 정적 데이터가 아니라, GPU가 상당한 계산 자원을 소비한 후 생성되는 "작업 메모리"입니다. 손실되면 재생성하려면 비용이 많이 드는 GPU 계산과 전기가 필요합니다.

SanDisk는 적절한 비유로 이를 포착합니다. SSD는 "토큰 배터리"로 진화했습니다. 토큰은 이미 완료된 계산 작업을 나타냅니다. 이들을 버리고 다시 계산하는 대신, 저장소에 "충전"하는 것이 훨씬 더 경제적입니다. KV 캐시 저장은 결국 클라우드 제공자의 계산 및 전력 비용 절감으로 귀결됩니다.

이러한 변화를 가능하게 하는 세 가지 조건이 있습니다. 첫째, HBM 용량 확장은 KV 캐시 성장 속도를 따라가지 못합니다. 모델 컨텍스트 길이는 매년 2배 이상 증가했습니다. GPT-3의 2020년 2K 토큰에서 2026년 백만 토큰 컨텍스트까지, 6년간 500배 증가했습니다. Nvidia의 Rubin NVL72 랙은 제약을 잘 보여줍니다. 약 15.4 TB의 풀 HBM은 용량에서 동시 백만 토큰 세션 193개에서 230개만 지원할 수 있으며, 이는 클라우드 제공자의 극히 낮은 계산 수익화 효율로 해석됩니다.

둘째, 비용 차이는 상당합니다. HBM4는 약 GB당 16달러이지만, 엔터프라이즈 SSD는 GB당 약 0.30~0.40달러에 불과합니다. 이는 40~50배의 차이입니다. "따뜻하거나 찬" KV 캐시를 액세스하지 않으면서 HBM에 보유하는 것은 자원의 심각한 오배분입니다.

셋째, 엔지니어링을 통해 지연 시간 문제가 해결되었습니다. GPU Direct Storage (GDS) 기술은 CPU와 DRAM을 우회하여 엔터프라이즈 SSD와 GPU 메모리 사이의 직접 채널을 구축합니다. 공개된 검증에 따르면 GDS를 압축과 결합하면 KV 캐시 복구 지연 시간을 10배 개선할 수 있으며, 오프로딩을 상업적으로 실행 가능하게 만듭니다.

Nvidia는 새로운 계층화된 메모리 아키텍처를 구축했습니다. G1 HBM → G2 시스템 DRAM → G3 로컬 SSD → G4 공유 네트워크 저장소이며, NVIDIA Dynamo에 의해 소프트웨어 계층에서 오케스트레이션됩니다. Rubin 플랫폼은 G3.5 계층으로 정의된 ICMS/CMX 컨텍스트 저장소 계층을 추가하며, 계층당 약 16 TB의 용량을 갖추고 있습니다. 이는 단일 GPU의 288 GB HBM의 거의 60배입니다.

KV 캐시 오프로딩의 경제는 캐시 적중률에 달려 있습니다. Manus 팀의 공개에 따르면, 캐시 적중에서 제공되는 토큰은 캐시 미스보다 약 10배 저렴합니다. 일반적인 대형 모델 적중률은 40%~70% 범위이지만, 다단계 Agent 시나리오는 시간이 지남에 따라 95% 이상을 유지할 수 있으며, "한 번 쓰고 천 번 읽는" 배당금을 발휘합니다.

**세 가지 핵심 워크로드에 걸친 역할 분담**

SanDisk는 2030년까지 AI 데이터센터 낸드 출하량이 1.2 ZB에 도달할 것으로 추정합니다. 이는 2026년 수준의 약 3배입니다. 세 가지 핵심 워크로드는 명확하게 정의된 역할을 가지고 있습니다.

| 워크로드 유형 | AI 데이터센터 낸드 수요 점유율 | 주요 낸드 유형 | 핵심 특성 |

|---|---|---|---|

| 스테이징 계층 | 40% | 고성능 TLC 및 pSLC | GPU 근처의 높은 강도 I/O 버퍼, 가장 높은 쓰기 부하 |

| KV 캐시 오프로드 계층 | 35% | TLC/QLC 계층화 | 추론 시대의 완전히 새로운 증분 수요, HBM 오버플로우를 동적 저장소로 흡수 |

| 빠른 데이터 레이크 | 25% | 고용량 QLC | 원격 중앙 집중식 데이터 저장소, 읽기 기반 |

*데이터는 2030년 AI 데이터센터 낸드 수요의 SanDisk 예측 분석에서 출처.*

낸드 유형별로, TLC는 66%를 차지하고 QLC는 34%를 차지합니다. 스테이징은 쓰기 강도로 인해 본질적으로 QLC를 제외하며, TLC가 기반을 확실히 잡고 있습니다. QLC는 데이터 레이크 및 따뜻하거나 찬 KV 캐시 오프로딩에 집중합니다. 두 워크로드 범주는 발산하고 있습니다. 데이터 레이크는 "더 저렴함"으로 향하고, 스테이징 및 핫 경로는 "더 빠르고 더 내구성 있음"으로 향합니다.

pSLC의 부상은 특별한 주의를 받을 가치가 있습니다. 여기에는 TLC 또는 QLC 다이를 SLC로 사용하여 약 2/3의 효과적인 용량을 희생하여 10배 이상의 내구성과 더 낮은 쓰기 지연 시간을 교환하는 것이 포함됩니다. 핵심 드라이버는 RAG (Retrieval-Augmented Generation) 및 Agentic Search의 높은 주파수 벡터 검색입니다. AI 에이전트는 극도로 세분화된 데이터 입도로 액세스하며, 동시성이 높고, 동시에 읽고 쓰므로 표준 TLC 내구성을 빠르게 소진합니다. 동등한 효과적 용량을 달성하려면 pSLC의 웨이퍼 출력이 3~4배 필요하므로 낸드 공급에 추가 부담을 줍니다.

**HBF: 낸드 제조업체의 "상향 돌파"**

전통적인 AI 저장소 계층 구조에서 HBM과 NVMe SSD를 분리하는 심각한 지연 시간 및 대역폭 격차가 있습니다. 낸드 제조업체는 이제 고대역폭 플래시(HBF)를 추진하고 있습니다. 이는 아키텍처가 기본적으로 HBM을 복제하는 새로운 제품 범주입니다. 다층 스택, 관통 실리콘 비아(TSV), XPU와의 공동 포장이 있습니다. 단, NAND 다이가 DRAM 다이를 대체합니다.

개발 중인 SanDisk의 HBF는 16층 낸드 스택을 특징으로 하며, HBM급 대역폭을 유지하면서 용량을 8배 증가시킵니다. 공개에 따르면, 2026년 말에서 2027년 초 사이에 출시될 계획인 HBF Gen1은 스택당 최대 512 GB를 제공할 것으로 예상되며, 16층 HBM4는 단 48 GB입니다. 업계 연구에 따른 GB당 가격은 HBM의 1/5에서 1/10에 불과할 수 있습니다. 읽기 대역폭은 최대 1.6 TB/초에 도달할 수 있으며, 이는 HBM4 최대 사양 대역폭의 약 55%입니다.

그러나 HBF의 제한도 마찬가지로 분명합니다. 낸드는 본질적으로 높은 지연 시간(약 1~10 마이크로초, DRAM의 약 0.1 마이크로초 대비), 느린 쓰기, 블록 기반 읽기, 제한된 프로그래밍/지우기 내구성을 가지고 있습니다. HBF는 HBM을 절대 대체하지 않을 것입니다. 완전한 모델 파라미터, 압축된 컨텍스트 캐시, 휴면 MoE 전문가 파라미터 같이 거의 읽거나 쓰지 않는 데이터에만 적합합니다.

현재 SanDisk와 SK Hynix만이 HBF의 실질적인 지지자입니다. 둘은 표준 연합을 구성했고 파일럿 라인을 구축했으며, 2027년 양산을 목표로 하고 있습니다.

*(참고: 소스 텍스트는 여기서 끝나며, 추가 콘텐츠는 잘렸습니다.)*

원문 보기
AI 추론 워크로드가 이제 NAND 플래시 수요의 가장 큰 주도 요인으로,… · Slicast