Nvidia Vera Rubin 컴퓨팅 아키텍처가 효율성과 확장성을 위한 GPU 설계 재정의
에이전틱 AI(Agentic AI)는 급속히 확장되는 자율 시스템을 실행하는 데 필요한 컴퓨팅 아키텍처를 재고하도록 주요 기술 공급업체들을 이끌고 있습니다. 6월, CoreWeave Inc.와 Nvidia Corp.는 CoreWeave Cloud에서 Nvidia Vera Rubin NVL72의 첫 번째 가동 시작(bring-up) 및 검증을 발표했습니다. 이는 워크로드가 지속적으로 추론하고, 예측 불가능하게 스케일링되며, 연중무휴 프로덕션 환경에서 운영될 수 있는 환경을 제공하는 것을 목표로 하는 근본적으로 새로운 인프라 접근 방식입니다.
이 시스템은 단일 랙 내에 72개의 Rubin GPU, 36개의 Vera CPU, 그리고 초당 260테라바이트(NVLink 6 대역폭)의 데이터 대역폭을 포함합니다. CoreWeave의 제품 및 엔지니어링 담당 부사장인 Chen Goldberg에 따르면, 이 대역폭은 전 세계 인터넷 전체가 사용하는 데이터 대역폭보다 많습니다. Goldberg는 "세상은 AI에게 질문을 하는 시대에서 멈추지 않고 대규모로 지속적으로 실제로 작업을 수행하는 AI 시대로 전환되고 있습니다"라고 말했습니다. "에이전트는 코드를 작성하고, 실험을 실행하며, 다단계 추론 루프를 수행합니다. 이것이 바로 Vera Rubin이 설계된 목적입니다."
Vera Rubin NVL72는 단순한 GPU 밀도 이상의 성능을 요구하는 대규모 추론, 지속적 추론 세션, 그리고 프로덕션용 AI 워크로드를 지원하도록 설계되었습니다. Nvidia의 고급 칩 아키텍처 덕분에 CoreWeave는 액체 냉각, 랙 제어, 네트워킹, 그리고 안전한 멀티 테넌트 운영을 포함한 여러 시스템 솔루션을 제공할 수 있었습니다.
CoreWeave의 액체 냉각 솔루션인 Valvey는 유량, 온도, 압력 및 누수 감지를 실시간으로 모니터링합니다. Goldberg는 "우리는 서브-초 단위 시간 척도로 단일 밸브를 제어할 수 있습니다. 만약 누수를 감지하면 즉시 조치를 취합니다"라고 설명했습니다.
새로운 통합 랙 제어 장치인 Racky는 전력, 냉각 및 환경 센서를 표준화된 관리 표면으로 집계합니다. CoreWeave의 최고기술책임자(CTO)인 Peter Salanki에 따르면, 이를 통해 각 Vera Rubin 랙을 맞춤형 일회성 빌드가 아닌 클라우드 리소스로서 관리할 수 있습니다. Salanki는 "Racky는 GPU 자체의 텔레메트리, 전력 시스템의 텔레메트리, 누수 센서 및 빌딩 관리 시스템에서 데이터를 수집하여 모든 요소를 연결합니다"라고 말했습니다.
단일 랙 내에 여러 CPU와 GPU가 존재함에 따라 통신은 특히 중요해집니다. 이번 발표에는 Nvidia Quantum-X800 InfiniBand와 Converged Ethernet 상의 RDMA(RoCE)를 지원하는 Nvidia Spectrum-X 이더넷 모두를 지원하는 멀티 레일(multi-rail) 및 멀티 플레인(multi-plane) 네트워킹이 포함됩니다. Nvidia의 제품 리더인 Dion Harris는 "이 랙 스케일 시스템의 핵심은 메모리, 컴퓨팅, 그리고 모든 파브리크(fabrics)를 스케일링하여 GPU 1번이 GPU 72번과 동일한 속도로 통신할 수 있게 해준다는 점입니다"라고 말했습니다. "이는 전체 랙에 걸쳐 워크로드를 매우 일관되고 신뢰할 수 있는 방식으로 스케일링할 수 있게 해줍니다."
CoreWeave는 더 빠른 데이터 액세스와 낮은 지연 시간을 갖춘 안전한 멀티 테넌트 AI 클라우드 운영을 가능하게 하기 위해 Nvidia BlueField-4 DPU(데이터 처리 장치)를 활용하고 있습니다. BlueField-4를 통해 테넌트는 통제력과 보안을 유지하면서 전체 Vera Rubin 컴퓨팅 플랫폼 전반에 걸쳐 워크로드를 실행할 수 있습니다. CoreWeave의 제품 디렉터인 Harshdeep Banwait는 "우리는 모든 구성 요소를 통합하고 검증 절차를 거쳐 Vera CPU가 Rubin 칩, ConnectX NIC, 그리고 BlueField-4 DPU와 함께 작동함을 확인했습니다"라고 말했습니다.
랙 스케일 플랫폼을 구현하기 위해 CoreWeave는 파트너 생태계를 활용했습니다. Dell은 고성능 PowerEdge XE9812 서버를 통해 아키텍처의 핵심 기반을 제공했습니다. Dell의 수석 부사장 겸 CTO인 Ihab Tarazi는 "AI 모델이 트릴리언 파라미터 규모로 확장되고 컨텍스트 윈도우가 수백만 개의 토큰을 포괄함에 따라, 컴퓨팅 밀도의 중요성이 커지고 있습니다"라고 언급했습니다. "진짜 중요한 모든 새로운 모델은 트릴리언 파라미터 모델입니다. 이러한 모델은 더 이상 8웨이 GPU 표준 서버에 적합하지 않습니다. 이들은 확실히 NVL72 GPU 시스템이 필요합니다."
CoreWeave의 검증 결과는 프로덕션 환경에서 에이전틱 AI를 지원하는 추론 성능의 필요성을 강조합니다. 최근 몇 년간 추론 시장은 기하급수적으로 성장했으며, 이는 Vera Rubin이 이전에 불가능했던 비용과 성능 수준으로 학습과 대규모 추론 모두를 지원할 수 있는 기회를 제공합니다. CoreWeave의 제품 수석 부사장인 Corey Sanders는 "그 일환으로 완전히 새로운 워크로드들이 탄생하고 있습니다"라고 말했습니다.
이러한 새로운 워크로드는 에이전틱 AI의 증가된 채택에 의해 주도되고 있으며, CoreWeave는 이를 지원하는 클라우드 인프라를 구축하기 위해 일련의 조치를 취했습니다. 여기에는 2025년 AI 모델 개발 기업인 Weights & Biases Inc.의 인수가 포함됩니다. 이후 CoreWeave 플랫폼에는 새로운 Weights & Biases 에이전틱 AI 도구들이 추가되었습니다. CoreWeave 내 Weights & Biases의 창립자이자 CTO인 Shawn Lewis는 "처음으로 Weights & Biases 내부에 AI 사용자가 모델을 훈련하고 AI 애플리케이션을 구축하는 데 도움을 주는 에이전트가 등장했습니다"라고 말했습니다. "W&B Launch는 Weights & Biases 툴킷을 인프라와 다시 연결하여, 인간이 개입하지 않아도 에이전트가 실험을 CoreWeave 인프라로 직접 시작할 수 있게 합니다."