Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

Groq의 Language Processing Unit(LPU), NVIDIA Vera Rubin 플랫폼 통합(특화된 추론 가속기 주류화)

GPU 외 추론용 대안 칩 아키텍처 검증, 컴퓨팅 전문화·이기종 시스템 전환 신호
업계 전문지Slicast · 2026년 6월 25일 09:45 UTC · 중국 · 출처: 雷锋网
중요도 87

AI가 트레이닝 시대에서 인퍼런스 시대로 전환되면서 단일 범용 아키텍처들이 효율성의 한계에 부딪히기 시작했습니다. 변화가 일어났습니다. "GPU만으로 모든 것을 정복한다"는 내러티브는 더 이상 지속되기 어려워졌고, 칩 업계에서는 전문화된 분업이 점차 합의로 형성되어 갔습니다.

Google은 차세대 TPU에서 트레이닝-인퍼런스 분리를 추진하고 있으며, Anthropic은 메모리 내 컴퓨팅 아키텍처에 베팅하고 있습니다. SambaNova는 "CPU+GPU+RDU" 시스템 솔루션을 출시했고, Cerebras는 웨이퍼급 칩으로 전통적인 GPU 클러스터에 도전하기로 선택했습니다.

Groq의 LPU(Language Processing Unit)가 NVIDIA의 Vera Rubin 플랫폼에 통합되면서, 이전에는 "니치 경로"로 여겨졌던 LPU가 처음으로 주류 AI 인프라에 진입했습니다. 업계에게 이는 새로운 칩 종류의 인정을 의미할 뿐 아니라 하나의 변곡점을 나타냅니다. 인퍼런스 시대가 서로 다른 칩이 서로 다른 작업을 담당하는 로직을 수용하기 시작했다는 뜻입니다.

중국의 국내 시장도 유사한 변화를 느끼고 있습니다. 데이터플로우 아키텍처, 고대역폭 SRAM 저장소 및 기타 인퍼런스 가속 방식을 중심으로 다양한 새로운 솔루션들이 지속적으로 등장하고 있으며, 자신만의 LPU 스토리를 전하고자 하는 플레이어들이 속속 나타나고 있습니다.

AI 칩 전문화 트렌드가 점점 명확해지는 가운데, LPU는 순환적인 핫토픽일까요, 아니면 인퍼런스 시대의 항구적인 새로운 직책일까요? 그리고 트랙이 점점 더 혼잡해질수록, LPU가 진정한 필요를 충족시킨다 하더라도 독립적인 LPU 회사가 실행 가능한 비즈니스일까요?

NVIDIA의 최신 솔루션은 25% Groq LPU와 75% Vera Rubin을 결합하여 끝없는 고가치 토큰 생성 수요의 흐름을 처리합니다.

이러한 접근 방식의 배후에는 Agent 시대 규칙의 재작성이 있습니다. AI 애플리케이션은 더 이상 일회성 Q&A 세션이 아니며, 지속적인 추론 워크플로우가 토큰의 폭증을 트리거하고 있습니다. 인프라 경쟁은 단일 칩 성능 비교에서 시스템 수준의 효율성 최적화로 확대되고 있습니다.

가장 먼저 명확해진 것은 Prefill과 Decode 간의 구분이었습니다. 하나는 더 높은 컴퓨팅 밀도에 초점을 맞추고, 다른 하나는 응답 속도와 시스템 처리량 능력에 더 많이 의존합니다.

하지만 업계는 곧 Decode 내에서도 서로 다른 워크로드가 서로 다른 최대 요구사항을 가지고 있음을 발견했습니다. Attention은 거대한 KV 캐시를 전송하고 읽기 위해 바쁘고, 많은 토큰 생성 작업은 FFN(피드포워드 신경망)에서 발생합니다.

차이가 인식되면, 차별화된 협력의 필요성이 더 긴급해집니다. 서로 다른 유형의 칩들이 인퍼런스 시스템에 진입하고 있으며, 각각 자신이 가장 잘하는 작업을 처리하고 있습니다.

Groq의 LPU는 이러한 배경 속에서 시장에 다시 진입했으며, Vera Rubin 플랫폼의 새로운 구성 요소로 작동하여 LPX 시스템 형태로 FFN 관련 워크로드를 대상으로 합니다.

"극저지연 인퍼런스 및 GPU 처리에 부적합한 기타 극단적 시나리오는 LPU로 넘길 수 있습니다"라고 아키텍처 엔지니어 Xiaofang이 설명합니다. "마치 고객을 서빙하기 위해 전용 특급 차선을 여는 것과 같습니다."

실제로 LPU는 무에서 나온 것이 아닙니다. Groq는 2016년에 설립되었고, 그 핵심 아키텍처 설계도 이전 AI 시대에서 태어났습니다. 하지만 그 이후 오랫동안 이러한 전문화된 칩들은 주류 시장에 진입하지 못했습니다.

소식통에 따르면, NVIDIA가 2025년 초 NVLink 상호연결 생태계를 파트너들에게 처음 개방한 후, Groq는 적극적으로 접근 기회를 모색했으며, 원래 GPU 간 통신을 위해 설계된 프로토콜 지원을 받기를 희망했습니다.

GPU-LPU 협력 운영의 실행 가능성이 검증되면서, 양사의 협력은 실질적인 기반을 얻었습니다. 그리고 NVIDIA의 자체 전략 변화는 더 큰 상상의 공간을 가져왔습니다.

AI 시스템 아키텍트 Xu는 Transformer 인퍼런스를 위해 특별히 설계된 더 많은 새로운 칩들이 등장할 것이라고 관찰했습니다. "단일 칩으로 리더십을 달성하는 윈도우가 좁혀지고 있습니다"라고 그는 말합니다. "하지만 시스템 수준의 아키텍처 혁신을 통해 NVIDIA의 리드 우위를 수 개월에서 1~2년으로 연장할 수 있습니다."

다시 말해, NVIDIA에게는 LPU를 도입하는 것이 GPU를 대체하는 것이 아니라 특정 인퍼런스 작업에 더 적합한 역할을 찾는 것입니다.

전문화는 LPU에 새로운 기회를 가져다주지만, 기회를 시장으로 전환하는 것은 또 다른 문제입니다. 더 많은 회사들이 LPU 트랙으로 몰려들면서, 더욱 실질적인 질문이 떠오르고 있습니다. LPU가 제공할 것으로 예상되는 기술적 우위의 실질적 내용은 무엇일까요?

"단일 칩 결정론적 지연은 LPU의 독점이 아닙니다. 모든 ASIC이 그것을 달성할 수 있습니다. 정말로 어려운 것은 여러 칩, 랙, 클러스터 간의 정밀한 오케스트레이션입니다"라고 한 전문가가 말합니다. 그의 관점에서 이것은 LPU의 가장 깊은 해자이며 국내 비주요 회사들이 극복하기 어려운 장벽입니다.

하지만 한때 대형 테크 회사에서 칩 소프트웨어 스택 설계를 주도했던 Tim은 더 신중한 입장을 취하고 있으며, 컴파일러 능력 가치가 모델 폼 팩터와 밀접하게 연결되어 있다고 믿습니다.

CNN 시대에는 모델 구조가 다양하고 연산자가 많아서 컴파일러가 활약할 충분한 기회를 가졌습니다. 하지만 Transformer가 업계 표준이 되면서, 대규모 모델 핵심 연산자는 지속적으로 수렴하였고, 많은 레이어 구조가 고도로 반복적입니다.

한편, MoE(Mixture of Experts) 같은 동적 아키텍처의 부상은 완전히 정적인 시스템의 장점을 침식하고 있습니다.

"실질적으로 모든 최상위 모델이 이제 MoE 구조를 가지고 있습니다"라고 Tim은 말합니다. "인퍼런스 중 동적 특성은 완전히 정적인 시스템에 특별히 친화적이지 않습니다."

그는 서로 다른 요청이 인퍼런스 중에 서로 다른 전문가 조합을 활성화하며, 이 정보는 컴파일 타임에 알 수 없다고 추가로 설명합니다.

Mark도 유사한 견해를 표현합니다. 그의 비GPU 칩 스타트업은 이미 여러 주요 달러 펀드로부터 투자를 확보했습니다.

"시스템이 미리 정해진 속도로 실행되도록 보장하려면, 컴파일러는 최악의 경우만 계획할 수 있습니다"라고 그는 지적합니다. "경화된 하드웨어 측도 전체 동기화를 유지하기 위해 특정 중복성을 유지해야 하며, 이는 일부 이론적 장점이 상쇄되게 합니다."

LPU 소프트웨어 능력에 관해서는 업계가 합의에 도달하지 못했습니다. 비교적으로, 또 다른 저장소 "트럼프 카드"인 SRAM은 정량화하기가 더 쉬워 보입니다. 많은 종사자들은 이것이 LPU의 핵심 경쟁력이라고 믿습니다.

NVIDIA의 공표된 데이터에 따르면 단일 Groq 3 LPU는 150 TB/s SRAM 대역폭을 가지고 있으며, 이는 H100 HBM3의 약 45배입니다. 256개 LPU LPX 캐비닛에서 총 대역폭은 추가로 40 PB/s로 밀려올라갑니다(참고: 1 PB/s = 1000 TB/s).

높은 대역폭 능력을 넘어, 칩 업계 베테랑 Yang도 이 경로의 HBM 공급망 및 고급 패키징 제약을 우회하는 장점을 봅니다.

현재 AI 칩 비용 구조에서 저장소의 영향은 계속 상승하고 있습니다. Epoch AI 데이터에 따르면 HBM의 AI 칩 부품 비용 점유율은 2024년 초의 52%에서 2025년 말까지 63%로 증가했습니다.

HBM이 더 많은 비용을 소비하면서, 시장은 SRAM의 가치를 재평가하고 있지만, 의견 불일치가 지속됩니다.

노련한 칩 제품 관리자 Gu는 명확히 말합니다. "SRAM은 실제로 LPU의 거대한 결함입니다." 그녀는 SRAM의 최대 특성이 속도이지만 대가는 작은 용량과 높은 단위당 비용이라고 믿습니다.

그러나 IO Capital 창립자 Zhao는 완전히 동의하지 않습니다. 그는 저장소 단위 가격을 단순히 비교하는 것이 의미가 부족하다고 생각합니다.

"SRAM이 수백 MB 대 HBM의 수십 또는 수백 GB일지라도, SRAM의 단위당 가격이 HBM보다 높더라도, 용량 격차에 직면하면 HBM의 총 비용이 궁극적으로 더 높을 수 있습니다."

SRAM도 자체 용량 불안감을 가지고 있습니다. 10년 이상의 경험을 가진 칩 컴퓨트 아키텍처 전문가 Xiaodong은 SRAM이 칩에 직접 통합되어 있으며 컴퓨팅 유닛과 동일한 실리콘 면적을 공유해야 한다고 지적합니다. 이는 면적 할당이 항상 어려운 문제라는 의미입니다.

"DRAM 저장 유닛은 1개의 트랜지스터와 1개의 커패시터만 필요하지만, SRAM은 6개의 트랜지스터가 필요합니다"라고 그는 추가합니다. "동일한 면적에서 SRAM은 자연스럽게 더 적은 데이터를 저장합니다."

공개 데이터에 따르면 Groq 3 LPU는 약 500MB SRAM을 통합하고 있으며, TPU 8i는 약 384MB를 가지고 있습니다. Cerebras의 WSE-3이 웨이퍼급 통합을 통해 용량을 44GB로 높였지만, 대가는 수율과 비용에서 이중 처벌입니다.

SRAM의 저렴함 대 비싼다는 논의는 다양한 각도를 가지고 있습니다. 하지만 더 가치 있게 의문을 제기할 점은 인퍼런스 시대에 어떤 지표가 가치를 측정해야 하는가 입니다.

Mark는 그것이 토큰이라고 믿습니다. 그의 관점에서는 "시스템 비용"에서 "토큰 비용" 평가 지표로의 변화가 일어나고 있습니다.

지난 몇 년간 업계는 "모델을 배포하기 위해 몇 개의 카드가 필요한가"를 논의하는 데 익숙해졌습니다. 따라서 많은 벤더들은 더 적은 GPU로 배포를 완료하는 것을 강조했습니다.

그는 8개의 GPU로 모델을 배포할 수 있는 일부 솔루션의 예를 들지만, 인퍼런스 비용이 반드시 최저인 것은 아닙니다. DeepSeek이 공개적으로 자신의 인퍼런스 클러스터를 구축하기 위해 144개 카드를 채택한 후, 업계는 또 다른 가능성을 깨달았습니다.

"전체 시스템 비용이 크게 증가했지만, 더 큰 클러스터 규모는 더 높은 대역폭, 더 높은 토큰 처리량, 더 낮은 토큰당 비용을 가져왔습니다"라고 Mark는 분석합니다.

의견 불일치는 사라지지 않았으며, LPU의 장점은 실질적인 비용을 따릅니다. 하지만 최소한 한 가지 점은 합의를 이루었습니다. LPU는 인퍼런스 시스템에 대한 진입 티켓을 확보했습니다.

그것이 다음으로 대답해야 할 것은 시장이 계속 묻고 있는 지속적인 현실 질문입니다. 이것이 지속적으로 수익을 생성할 수 있는 비즈니스일까요?

NVIDIA의 후원을 받기 전에, Groq는 이미 독립적인 엔드투엔드 인퍼런스 배포 능력을 활용하여 Saudi Arabia의 인퍼런스 인프라 프로젝트를 획득했고, 유럽에 대규모 컴퓨팅 센터를 배포했으며, Meta의 Llama 생태계에 진입했습니다.

"이 트랙에 베팅하는 기업들은 목표 고객을 가져야 합니다"라고 Zhao가 설명합니다. "소프트웨어 컴파일과 최적화가 궁극적으로 특정 애플리케이션을 대상으로 하기 때문입니다."

다시 말해, LPU의 상용화 도전은 단순한 기술 구현이 아니라 누군가 돈을 지불할 의지가 있는지입니다. 하지만 무시할 수 없는 문제가 있습니다. LPU가 가장 필요한 사람들은 종종 자체 개발할 능력이 가장 강한 사람들입니다.

Xu는 대형 모델 회사와 기술 거인들이 이미 움직이기 시작했다고 관찰했습니다. "GPU에 비해 LPU는 훨씬 더 간단합니다. 1~2년이면 하나를 구축할 수 있습니다."

하지만 고객이 경쟁자가 되는 것이 최악의 뉴스는 아닙니다. "스타트업은 LPU만으로는 생존할 수 없습니다. 그들은 '대중'을 찾아야 합니다. NVIDIA는 이미 '대중'을 가지고 있는 위에 '페라리'를 추가하고 있습니다. 그것은 케이크 위의 아이싱입니다"라고 Gu는 명확히 말합니다.

Mark는 이러한 전문화가 계속 심화될 것이라고 지적합니다. "Attention과 FFN 간의 분리 정도는 높으며, 그들 사이의 통신 대역폭 요구사항은 높지 않습니다. 따라서 이기종 시스템이 외부인들이 상상하는 거대한 비용을 가져올 필요는 없습니다."

Tim도 향후 인퍼런스 솔루션이 이기종 형태로 존재할 가능성이 높다고 믿습니다. "모든 최적화가 수억 달러의 수익을 가져올 때, R&D 비용은 쉽게 상각됩니다."

Zhao의 관찰에 따르면, 많은 기업들이 이미 유사한 경로를 모색하고 있습니다. 대용량 SRAM과 분산 저장소를 사용하여 인퍼런스 워크로드를 완료하고 있습니다. "지금은 그것을 LPU라고 부를 뿐입니다"라고 그는 꿰뚫어봅니다.

Xiaofang은 DPU의 발전 궤적을 상기했습니다. 2020년경 DPU 개념이 등장하면서 수많은 스타트업들이 트랙으로 몰려들었고, 몇 년 후 많은 회사들이 변모했습니다. 그녀의 관점에서 LPU는 유사한 스크립트를 재현할 수 있으며, 부분적으로는 시장 배양 사이클이 길기 때문입니다.

Zhao는 새로운 컴퓨팅 아키텍처가 정착하는 데 시간이 필요하다고 설명하며, NVIDIA GPU가 대량 채택을 달성하는 데 10년이 걸렸던 것과 같습니다.

하지만 스타트업에게는 이것이 가장 치명적인 위험입니다. 고도로 전문화된 ASIC으로서 LPU는 자연스럽게 현재의 주류 모델 아키텍처에 의존합니다. 만약 기초 모델이 근본적으로 변한다면, 관련 최적화 가치는 재평가될 수 있습니다.

이에 Mark는 다른 각도에서 대응합니다. "이는 실제로 스타트업에게 기회를 제공합니다. 왜냐하면 주요 회사들이 그렇게 높은 위험을 감수하기를 원하지 않을 수 있기 때문입니다."

한편, Xiaodong은 상대적으로 낙관적입니다. 그는 CNN 시대 AlexNet이 현대 딥러닝 물결을 촉발한 이후, AI 패러다임이 지난 10년간 지속적으로 진화했지만, 기본 논리는 근본적으로 변하지 않았다고 지적합니다. 향후 새로운 아키텍처는 Transformer-Plus일 가능성이 더 높습니다.

Tim은 유사한 판단을 제시합니다. "모델이 광대한 지식으로부터 정보를 필터링하고, 호출하고, 결합할 필요가 있는 한, 높은 대역폭에 대한 수요는 사라지지 않을 것입니다. 이 필요에 기반하여 칩을 설계하면, Transformer가 대체되더라도, 칩 자체는 구식이 되지 않을 것입니다."

시장은 새로운 칩 스토리가 부족하지 않습니다. LPU 회사의 생존을 진정으로 결정하는 것은 아키텍처가 얼마나 고급인지가 아니라, 시장이 성숙해지기 전에 고객, 시나리오, 생태계를 찾을 수 있는지 입니다.

결국, 인퍼런스 시대는 정말로 점점 더 많은 "페라리"가 필요할 수 있습니다. 하지만 대부분의 스타트업에게, 페라리를 만드는 것보다 더 어려운 것은 누군가가 지속적으로 "대중-더하기-페라리" 조합을 구매하려는 사람을 찾는 것입니다.

원문 보기
Groq의 Language Processing Unit(LPU), NVIDIA… · Slicast