Sunday, October 11, 2026
AI 인프라 · 뉴스 & 분석
홈 › 반도체·하드웨어 › 리포트
반도체·하드웨어 · 리포트

Upscale AI는 Nvidia와 협력하는 동시에 경쟁하고 있다.

엔비디아와 협력하면서 동시에 경쟁하는 공급업체의 존재는, 엔비디아 생태계가 경쟁 AI 반도체 및 인터커넥트 제품을 수용할 여지가 있음을 시사한다.
업계 전문지Slicast · 2026년 10월 9일 21:15 UTC · 글로벌 · 출처: The Next Platform
중요도 45

모든 CPU 제조사는 여러 CPU를 공유 메모리 클러스터로 묶는 자체 독점 방식을 가져 왔습니다. CCIX 컨소시엄과 CXL 컨소시엄이 여러 CPU를 하나의 훨씬 큰 CPU처럼 보이게 만드는 일종의 범용 접착제를 만들려고 노력했음에도 불구하고, 대체로 여전히 그렇습니다.

CPU용 SMP 및 NUMA 표준을 만들려는 시도는 대부분 실패했습니다. 고객들은 CPU를 연결하는 표준화된 방법을 원했겠지만, 서로 다른 벤더의 서로 다른 아키텍처 CPU를 섞어 쓰는 워크로드가 있을 가능성은 낮아 보였습니다. 게다가 벤더들은 결국 CPU 자체에 내장되게 된 SMP 및 NUMA 칩셋을 코어 설계, 메모리 서브시스템, I/O의 발전과는 별개의 속도로 혁신할 수 있었습니다. 무엇보다도, 벤더들은 필요한 기능을 승인받기 위해 표준화 기구에 의존하지 않았기 때문에 원하는 대로 차별화할 수 있었습니다.

그렇다면 왜 GPU와 XPU를 위해, 오늘날 흔히 스케일업 네트워킹이라고 부르는 사실상 NUMA 상호연결에 해당하는 기술의 표준 버전이 등장할 것이라고 기대하는 걸까요? 희망은 끝이 없고, 시장은 비용을 낮추는 경쟁을 좋아하기 때문입니다. (대체는 아이디어가 좋아서가 아니라 경제학의 법칙입니다.)

분명한 것은 Nvidia가 NVSwitch와 NVLink 포트에 큰 프리미엄을 붙일 수 있고, 실제로 그렇게 한다는 점입니다. 이 제품들은 최대 72개의 GPU를 하나의 공유 메모리 시스템으로 묶어 주는데, 회사는 이를 NVL72 랙스케일 머신이라고 부릅니다. Nvidia는 NVLink Fusion 프로그램을 통해 맞춤형 CPU 제조사가 자사 장치에 NVLink 포트를 추가하여 Nvidia GPU와 같은 메모리 공간에 연결할 수 있도록 하고 있습니다. 마찬가지로 하이퍼스케일러, 클라우드 사업자, AI 모델 개발사가 만든 XPU 가속기에도 NVLink 포트를 허용하여 Nvidia 랙스케일 아키텍처 안에 배치할 수 있게 하고 있습니다. 우리가 아는 한, Nvidia는 아직 고객이 자체 CPU와 자체 XPU 모두에 NVLink 포트를 추가하고, NVSwitch와 NVLink 프로토콜 라이선스만 구매해 공유 메모리 시스템을 구축하는 것은 허용하지 않고 있습니다.

그런 날이 올 수도 있습니다. 제가 8월에 "In The Long Run, Nvidia NVSwitch Is The InfiniBand Of Scale Up AI Networks"에서 논의했듯이, Nvidia는 아주 먼 미래에, 그리고 적절한 기술이 시장에 나온다면, 특히 AI 추론을 위해 자체 프로토콜 오버레이를 얹은 업계 표준 스케일업 네트워크를 채택할 수도 있습니다. (AI 학습 분야에서는 Nvidia가 대다수 시장을 장악하고 있으므로, 그 영역에서 그만큼 양보할 이유는 없습니다.)

이런 이유로 Upscale AI가 흥미롭습니다. 저는 1월에 이 회사가 2억 달러의 시리즈 A 투자를 유치하던 무렵 대화를 나눴습니다. (회사의 역사나 여기에 관여한 주요 기업들은 다시 설명하지 않겠습니다. 배경이 궁금하면 그 기사를 읽어 보시기 바랍니다.) Upscale AI는 지금까지 총 5억 달러를 조달했습니다. 기업가치는 20억 달러로 두 배가 되었고, 직원 수는 그 1월 발표 이후 두 배 이상 늘어 300명을 넘었습니다. 이번 주 Upscale AI의 경영진은 AI 클러스터를 겨냥한 스케일업 및 스케일아웃 네트워킹 계획을 조금 더 공개했습니다.

너무 흥분하기 전에 말씀드리면, 여러 해 동안 개발되어 온 "SkyHammer" 스케일업 스위치 ASIC에 대한 세부 사양은 많이 공개되지 않았습니다. 이 회사의 공동 창립자이자 상임 이사장인 Rajiv Khemani와 최고경영자 Barun Kar는 고성능 시스템과 네트워킹 분야에서 오랫동안 깊은 경험을 쌓아 왔으므로, 흥미로운 전개가 있을 것으로 기대합니다.

웨비나에서 회사의 제품 및 마케팅 담당 수석부사장 Arvind Srikumar가 보여 준 슬라이드를 통해 확실히 알게 된 것은, SkyHammer의 총 대역폭이 115.2 Tb/sec라는 점입니다. 이는 최첨단 수준이며, 스케일아웃 네트워크 ASIC 분야에서 Cisco Systems, Broadcom, Nvidia의 최고 제품과 견줄 만합니다. 같은 차트에는 SkyHammer 칩과 이를 지원하는 SkyFabriX 아키텍처가 결국 여러 페타비트 per second 총 대역폭을 가진 스위치 장비로 이어질 것이라고도 나와 있습니다.

이는 Broadcom과 Cisco가 고정 포트 및 모듈형 스위치에서 흔히 하는 것처럼, 스위치 내부에서 여러 SkyHammer ASIC을 묶는 방식으로 달성될 가능성이 매우 높습니다. The Next Platform의 독자들은 지난 10년간 Broadcom과 Meta Platforms의 발표에서 보았듯이, 어떤 스위치 ASIC 아키텍처든 독립된 ASIC 여섯 개로 작은 2단계 네트워크를 구성하면 포트 대역폭을 두 배로 늘릴 수 있다는 것을 기억할 것입니다. 네 개의 ASIC 대역폭 절반은 다운링크에 쓰고, 나머지 절반은 같은 칩 두 개를 이용해 네 개의 ASIC을 교차 연결합니다. 이렇게 하면 스위치를 거치는 많은 포트 홉의 지연 시간이 두 배가 되지만, 모든 홉이 그런 것은 아닙니다. Broadcom의 "Jericho" 딥 버퍼 ASIC과 짝을 이루는 "Ramon" 장치 같은 전용 패브릭 커넥터를 사용하면 더 큰 모듈형 스위치를 만들 수도 있습니다.

경제성이 맞기 때문에 Upscale AI도 분명 더 높은 총 대역폭을 가진 장치를 만들 것입니다. ASIC 여섯 개로 포트당 기본 대역폭이 2배인 스위치를 만들 수 있지만, 대역폭이 2배인 단일 장치를 만드는 것에 비해 포트당 비용이 약 1.5배가 듭니다. (이는 ASIC 제조 원가가 아니라 시장 가격 기준입니다.) 회사는 향후 SkyHammer ASIC의 로드맵은 제시하지 않았습니다.

메모리 도메인 확장성과 관련해, SkyHammer 칩 아키텍처는 단일 네트워킹 계층에서 최대 576개의 가속기를 지원할 수 있습니다. NVSwitch와 마찬가지로 여러 네트워크 계층을 사용해 더 확장할 수 있으며, 이 경우 "수천 개의 가속기"까지 늘어납니다. 정확히 몇 천 개인지는 두고 볼 일이지만, 1,024개 또는 1,156개가 목표가 될 것으로 보입니다. UALink 컨소시엄은 단일 계층에서 1,024개의 XPU를 약속하고 있으며, Nvidia는 현재 576개 GPU인 NVSwitch의 한계를 "Rubin Ultra" GPU 세대에서 1,152개 GPU로 넓힐 계획입니다. (이는 단일 계층이 아니라 다중 계층 네트워크를 기준으로 한 것입니다.) Nvidia는 오늘날 단일 도메인에서 72개 GPU를 지원하며, 다중 계층으로 576개 GPU도 가능하지만 운영 워크로드용으로 의도된 것은 아닙니다.

SkyHammer의 576개 장치 수치를 계산해 보면, 장치당 200 Gb/sec의 대역폭이 주어집니다. 이는 "Grace-Blackwell" NVL72 시스템에서 NVSwitch 5/NVLink 5 세대가 제공하는 1.8 TB/sec에 비하면 확실히 훨씬 적습니다. "Vera-Rubin" NVL72 시스템에는 3.6 TB/sec를 제공하는 NVSwitch 6/NVLink 6이 탑재될 예정입니다. XPU 72개 기준으로 SkyHammer는 포트당 1.6 Tb/sec를 제공하는데, 이는 스케일업 네트워크를 통한 메모리 대역폭으로 환산하면 여전히 200 GB/sec에 불과합니다. NVSwitch 5 스택의 6분의 1 수준입니다. (저는 NVSwitch 명칭을 정규화했습니다.)

대역폭이 지연 시간보다 중요한지는 전혀 명확하지 않습니다. 특히 AI 추론 워크로드에서는 더욱 그렇습니다. 예측 가능한 지연 시간은 언제나 낮은 지연 시간보다 중요하며, 이는 Google이 우리에게 가르쳐 준 바이기도 합니다.

"토큰과 관련해 가장 중요한 지표 중 하나는 지연 시간입니다." Srikumar가 The Next Platform에 말했습니다. "우리는 토큰을 생산해야 하지만, 이 부분은 Rajiv와 Barun이 과거에 해 온 것과 조금 다릅니다. AI에서는 지연 시간이 극도로 예측 가능해야 하며, 우리는 예측 가능한 지터를 ASIC에 구현했습니다. 동시에 도메인 내부의 전송 신뢰성도 중요합니다. 링크 수준의 신뢰성을 제공하는 표준 기반 프로토콜이 일부 있지만, 패브릭 내부에는 패브릭이 100퍼센트 무손실이 되도록 보장하는 메커니즘이 있습니다. 그래서 우리는 이를 신뢰할 수 있고 예측 가능한 지연 시간이라고 부르며, 지연 시간을 최소화하고 있습니다. 구체적인 수치를 발표하면 놀라실 수도 있습니다. 많은 이더넷 패브릭을 보면 거의 고정된 파이프라인 구조에 병렬성이 적습니다. 여기서는 지금까지 이더넷 패브릭에서 이루어진 것의 한계를 밀어붙이는 많은 작업을 하고 있습니다. 이더넷 패브릭을 가져다가 스케일업에 필요한 프로토콜을 덧붙여 개조하는 대신 백지 상태에서 시작했기 때문에, SkyFabriX는 시장에서 독보적인 위치를 차지하게 될 것이라고 믿습니다."

누가 무엇을 믿든, 사람들이 이더넷 위에서 UALink(오늘날 통용되는 명칭으로 UALoE)를 실행하고, 스케일업용으로 조정된 고속 이더넷 스위치 위에서 ESUN 메모리 프로토콜을 돌리기 시작하면, 무엇이 효과가 있고 무엇이 없는지 곧 알게 될 것입니다.

흥미롭게도 SkyHammer는 네이티브 UALink가 아니라 UALoE를 실행하며, ESUN을 실행한다는 사실은 내부적으로 SkyHammer가 이더넷 스위치 ASIC이라는 것을 보여 줍니다. 저는 네이티브 UALink를 실행하고 필요할 때 ESUN을 에뮬레이션할 수 있는, 더 빠르고 포트 수(radix)가 많은 스위치 ASIC이 나오기를 기대했었습니다.

원문 보기
Upscale AI는 Nvidia와 협력하는 동시에 경쟁하고 있다. · Slicast