Tuesday, September 29, 2026
AI 인프라 · 뉴스 & 분석
홈 › 헤드라인 › 리포트
헤드라인 · 리포트

Cerebras는 새로 출시된 'Nexus' 아키텍처 기반 CS-4 랙 시스템에서 추론 처리량을 대폭 향상시키기 위해 WSE-3 웨이퍼스케일 엔진의 오버클럭킹을 적용했다.

이번 조치는 웨이퍼 생산 주문을 추가하지 않고도 사용 가능한 추론 용량을 추가로 확보하여, 고급 가속기의 단기 공급 상황을 더욱 긴박하게 만든다.
업계 전문지Slicast · 2026년 8월 19일 04:39 UTC · 글로벌 · 출처: The Next Platform
중요도 88

AI 컴퓨팅 분야에서 엔비디아와 직접 경쟁해 온 2세대 AI 하드웨어 스타트업 세라브라스 시스템즈(Cerebras Systems)는 올해 여름 차세대 플랫폼인 CS-4를 출시할 예정이다. 이 플랫폼의 코드명은 ‘넥서스(Nexus)’다. 공개 상장 전이자 2026년 IPO가 확정되기 전인 2025년 10월, 해당 기업의 11억 달러 자금 조달 라운드 분석 당시 나는 2026년 8월 발표 시점을 예측한 바 있다. 그 예상이 적중했다.

CS-4는 새로운 시스템 아키텍처와 이를 감싸는 독창적인 랙 설계를 도입하여 향후 여러 세대 제품의 기반을 마련하지만, 주목할 점은 차세대 WSE-4 컴퓨트 엔진이 탑재되지 않았다는 것이다. 대신 기존 WSE-3 웨이퍼 스케일 엔진의 오버클럭 변형 버전인 WSE-3 Turbo를 사용한다. TSMC의 5나노미터 공정으로 제조된 이 엔진은 동일한 90만 개의 코어와 44GB의 온웨이퍼 SRAM을 유지한다. N5 노드는 2026년에 세라브라스가 2024년 3월 WSE-3 엔진을 처음 출고했을 때보다 훨씬 더 성숙했기 때문에, TSMC는 세라브라스와 기업 고객 모두에게 유리한 N5 계열의 향상된 버전을 사용하고 있을 가능성이 높다.

WSE-3 Turbo는 표준 1.4GHz에서 2.8GHz로 클럭 속도를 높여 전작 대비 컴퓨트 처리량을 두 배로 늘린다. 그렇다면 세라브라스는 왜 2년 전부터 이러한 오버클럭을 적용하지 않았을까? 가장 타당한 설명은 필요한 전력 공급 및 열 관리 인프라가 아직 실현 가능하지 않았기 때문이다. CS-4 구성에서 컴퓨트 웨이퍼는 근본적으로 변경되지 않지만, 신뢰성을 해치지 않고 2배의 클럭 증가를 유지하기 위해 패키징을 통해 전력 입력량이 두 배가 되고 냉각 용량도 약간 두 배 이상으로 증가한다.

세라브라스의 네 가지 CS 세대에 걸친 과거 성능 지표는 플랫폼의 진화를 보여준다. 작년에는 CS-4 생태계 내 미래 WSE-4 엔진의 잠재적 사양을 모델링했으며, 이후 CS-4 Plus 또는 CS-5가 근본적으로 다른 실리콘 다이(die)를 도입할 수 있다고 제안했다. 여전히 웨이퍼 스케일 엔진은 궁극적으로 SRAM 용량에 의해 제약받는다고 평가하며, 이는 과거 최첨단 모델 추론 실행에 수십 대의 CS-2 및 CS-3 시스템이 필요했던 이유이기도 하다. 이 요구사항은 아마도 더욱 커졌을 것이다. 최신 예측에서는 “WSE-4 Harder” 시나리오를 반영했는데, 클럭을 2.8GHz까지 끌어올리고 I/O 대역폭을 두 배로 늘려 100만 개의 코어를 320GB SRAM과 더 잘 균형을 맞추며, 집합 대역폭은 초당 248PB에 도달하도록 했다. 이 아키텍처는 메모리가 컴퓨트 파브리로부터 멀리 떨어진 현재 HBM 기반 솔루션보다 현저히 뛰어난 성능을 발휘할 것이다.

공동 창업자 겸 CEO 앤드루 펠드먼(Andrew Feldman)과 공동 창업자 겸 CTO 섀인 리(Sean Lie)가 제시한 전략 로드맵에 따르면, 세라브라스는 엔지니어링 팀, 경영진, 고객층 사이에서 높은 기대감을 유지하고 있다. 이러한 전망에 따르면 넥서스 랙 아키텍처는 최소 세 가지 세대의 시스템을 지원하며, 세라브라스는 2029년까지 연평균 처리량을 2배씩 증가시키기로 약속했다. 이 속도는 전통적인 무어의 법칙 궤적을 크게 상회한다. 이 개선은 주로 SRAM 용량을 컴퓨트 밀도에 비해 증가시켜 코아 기아(core starvation)라는 GPU 아키텍처의 일반적인 병목 현상을 완화함으로써 피크 이론상 수치보다는 유효 성능을 목표로 하는 것으로 보인다. 나는 원래 WSE-3 코어가 SRAM 대역폭을 완전히 포화시키지 못했을 것이라고 강력히 의심하며, 이 한계는 WSE-3 Turbo에서도 지속된다. 메모리 용량을 컴퓨트 확장성과 일치시키기 위해 세라브라스는 결국 3D SRAM 스택킹을 채택해야 할 것이다. 웨이퍼 수준의 SRAM 용량을 유지하면서 코어 수를 줄이는 것은 단위 판매를 촉진하기 위해 메모리를 과소 배치한다는 것을 인정하는 것이므로 상업적으로 생존 불가능하다. 이는 엔비디아와 AMD GPU 가속제조사에서도 관찰되는 관행이다.

CS-4의 진정한 혁신은 넥서스 랙 아키텍처에 있다. 클럭 속도 향상을 통해 성능을 2배로 높이는 것은 유효한 단기 전략이지만, 클럭 속도를 이 새로운 한계선 너머로 무한정 높일 수 없으므로 추가적인 성능 향상은 아키텍처 전환을 필요로 한다. 재설계된 컴퓨트 노드는 WSE 웨이퍼와 호스트 AMD Epyc CPU를 전원 공급 장치 및 네트워크 인터페이스에서 분리한다. 이 분리는 각 하위 시스템의 독립적인 업그레이드를 가능하게 한다. 특히 NIC 모듈리티 덕분에 오픈AI(OpenAI)와 아마존 웹 서비스(Amazon Web Services)와 같은 파트너들은 선호하는 네트워크 인터페이스 카드를 통합할 수 있으며, 이는 세라브라스 WSE 엔진과 프리필l(prefill) 작업 및 GenAI 모델 학습에 사용되는 GPU 또는 XPU 간의 연결을 용이하게 한다.

물리적으로 넥서스 랙은 전면부에 세 개의 파워 쉘프와 후면부에 수직으로 장착된 세 개의 모듈식 CS-4 컴퓨트 백팩(backpack)으로 구성되어 있다. 이 백팩들은 파워 쉘프에 직접 플러그 인된다. 세라브라스는 새로운 기계 설계가 제조 자동화를 60% 개선했다고 보고했다. CS-1부터 CS-3 플랫폼이 랙당 하나의 WSE와 호스트 CPU를 포함하는 단일 16U 챔시스를 수용했던 것과 비교하면, 넥서스는 랙당 컴퓨트 밀도가 세 배다. 역사적으로 운영자는 열적 제약이 허용하는 한 규모 확장 네트워크 및 스토리지를 수용하기 위해 랙당 두 개의 레거시 챔시를 설치할 수 있었다.

리에(Lie)에 따르면 넥서스 랙은 대규모 배포에 최적화되어 있으며, 부품 수가 50% 감소하고 이전 세라브라스 시스템보다 최대 3배 빠른 배포 속도를 제공한다. 아키텍처의 폭발도(exploded view)는 백팩들이 후면 챔시스에서 연장되어 있음을 보여준다. 외관상으로는 스프링 로딩된 것처럼 보이지만 실제로는 그렇지 않으며, 각 컴퓨트 복합체는 약 100파운드의 무게를 가지고 있어 강제로 배출되지 않는다. 리는 세라브라스가 먼저 랙과 전원 인프라를 고객에게 배송한 후, 사이트 준비가 완료되면 WSE 백팩을 배송할 계획이라고 설명했다. 이러한 단계별 배송은 공급망 물류를 최적화하고 배포 일정을 가속화한다.

CS-4 백팩의 상세 내역을 살펴보면, 바닥에 파워 모듈이 있고 그 위에 WSE-3 Turbo 모듈이 위치하며, 나사 배열로 고정된 콜드 플레이트(cold plate) 아래에 단단히 고정되어 있다. 어셈블리의 상단과 하단에는 두 개의 네트워크 인터페이스 카드(NIC)가 배치되어 있다. “새로운 고속 웨이퍼 링크”를 참조하는 사양에 따르면, 웨이퍼 I/O 모듈은 초당 200Gb의 속도로 작동하는 여섯 개의 이더넷 포트를 갖추고 있다. 이는 초기 CS-1부터 CS-3 시스템에서 사용된 초당 100Gb I/O 모듈 대비 포트당 대역폭이 두 배 증가한 것이며, 이전 시스템은 단일 또는 듀얼 이더넷 파브리 인터페이스를 사용했다. 이전 I/O 구성과 관련된 문서 및 프레젠테이션은 모호했다.

NIC 라디스(radix)의 2배 증가는 이론적으로 세라브라스가 단일 데이터 병렬 클러스터에 대한 이전의 2,048개 노드 제한을 넘어 상호 연결성을 확장할 수 있게 해야 한다. 그러나 업계 분석에 따르면 세라브라스는 토폴로지나 라디스 개선과 관계없이 2,048개 노드 캡을 유지할 가능성이 높다. 이러한 네트워크 세부 사항에 대한 세라브라스의 확인 시도는 아직 응답을 얻지 못했다.

업데이트된 네트워크 하드웨어는 프로그래머블 저지션 패킷 파이프라인을 지원하고 웨이퍼 간 직접 링크를 가능하게 한다. 이러한 상호 연결의 정확한 구성 가능성은 명시되지 않았다. 확장된 CS-4 클러스터를 위한 스케일아웃 네트워크와 사용자 및 스토리지를 연결하는 프런트엔드 네트워크는 이더넷 스위치 제조사인 아리스타 네트워크스(Arista Networks)와의 파트너십을 통해 지원된다.

일부 선택된 고객들은 현재 CS-4 시스템에 조기 액세스할 수 있으며, 일반 가용성은 2026년 3분기 후반에 예정되어 있다. CS-4 플랫폼의 상세 성능 벤치마크 및 워크로드 분석은 별도 보고서로 게시될 예정이다.

원문 보기
Cerebras는 새로 출시된 'Nexus' 아키텍처 기반 CS-4 랙 시스템에서… · Slicast