Salience Labs는 GPU 인터커넥트용 실리콘 포토닉스 광학 스위치 기술을 개발하여 NVIDIA NVLink 구리보다 더 높은 대역폭과 낮은 레이턴시를 제공합니다.
광학 회로 스위치는 지난 20년 이상 네트워크 연구실과 통신사 생산 환경에서 사용되어 왔으나, 이제 고성능 컴퓨팅 클러스터의 스케일업 네트워킹 영역으로 진출할 준비를 갖추고 있다. Salience Labs는 광자 컴퓨팅 플랫폼 구축을 목표로 한 첨단 연구에서 파생된 실리콘 포토닉스 기술 기반의 광학 회로 스위치를 개발했다.
현재 생산 중인 광학 스위치에는 두 가지 유형이 있다. MEMS 기반 스위치는 섬유 광학 회로를 생성하기 위해 회전하는 미세 기계식 거울 어레이를 사용하는 반면, 실리콘 위의 액정(LCoS) 스위치는 다른 광학 메커니즘에 의존한다. Google은 2015년부터 'Apollo' OCS 백본의 일부로 'Palomar'라는 명칭의 MEMS 장치를 사용해 왔으며, 이를 통해 클러스터를 동적으로 재구성하고 일관된 메모리 클러스터에서 최대 9,216개의 TPU를 지원할 수 있게 되었다. Lumentum은 MEMS 기반 OCS 장비를 판매하며 Nvidia와 파트너십을 맺고 있고, Coherent은 LCoS 기반 OCS 장치를 제공하며 역시 Nvidia와 파트너십을 맺고 있다.
Salience Labs는 구체적인 스위칭 메커니즘을 공개하지 않았으나, MEMS나 LCoS를 사용하지 않는다. 이 회사는 옥스포드 대학교와 뮌스터 대학교에서 스핀아웃되었으며, Harish Bhaskaran(옥스포드의 응용 나노소재 교수)과 Wolfram Pernice(뮌스터의 실험 물리학 교수)의 연구를 바탕으로 설립되었다. 이들은 모두 Salience Labs의 공동 창립자이다. 그들의 연구는 상변화 광전자 공학(phase change optoelectronics)에 집중되었다. Tower Semiconductor와의 PH18DA 통합 III-V 레이저 및 TPS45PH 저손실 실리콘 나이트라이드 도파관을 사용한 파트너십은 실리콘 포토닉스 프레임워크 내에서 상변화 기술을 사용하고 있을 가능성을 시사한다.
임페리얼 칼리지 런던에서 물리학 학사와 석사 학위를 보유하고, 옥스포드 사이언스 엔터프라이즈에서 기업가 인 레지던스(entrepreneur in residence)로 활동한 CEO이자 공동 창립자 Vaysh Kewada는 정확한 스위칭 메커니즘을 특정하는 것을 거부했다. 회사는 32포트 OCS를 출시 중이며, 스케일업 AI 네트워크용 64, 128, 256포트 시스템 공급을 계획하고 있다.
Salience Labs의 접근 방식을 차별화하는 요소는 속도다. MEMS 및 LCS 스위치는 포트 간 링크 재구성에 밀리초(ms)가 소요되는 반면, 실리콘 포토닉스 도파관 스위칭은 300마이크로초(μs) 미만으로 작동한다. Kewada는 "우리는 CPO, NPO, XPO 분야에서 칩에서 데이터 추출 및 광섬유 전송 방법을 해결하려는 많은 솔루션 개발자들이 있는 가운데 OCS 개발을 선택했다"며 "데이터센터 내 광 연결이 더 많이 확립되었을 때 스위칭 아키텍처가 어떻게 보일지 고려했다. 우리는 단순한 가설을 가지고 제품을 개발했다. 즉, 데이터센터 내 광 연결이 증가하면 스위칭 계층이 전기 패킷 스위치와 광학 회로 스위치의 조합인 더 이종형 아키텍처로 이동할 것이라는 점이었다. 오늘날 이용 가능한 OCS는 최소 20년 이상 된 기술을 기반으로 하고 있으므로, OCS 시장은 교란(disruption)에 적합한 시장이라고 본다"고 말했다.
Salience Labs의 OCS는 두 개의 칩으로 구성된다: 완전히 통합된 실리콘 포토닉스 OCS와 고품질 구리 회로의 리타이머(retimers) 및 리드라이버(redrivers)와 유사한 증폭 및 신호 조건 처리 칩이다. PCB 카드에 백투백(back-to-back)으로 장착된 이 설계는 실리콘 포토닉스의 주요 과제인 광 손실을 해결한다. Kewada는 "칩에 통합하는 순간 광 손실이 발생한다"며 "우리는 자체 부품 설계를 사용하여 어레이로 제작함으로써 비용 목표(BOM cost goals)를 충족하는 방식으로 증폭을 통해 이를 해결했다. 이 증폭 칩은 유일무이하며 스택의 핵심이다"라고 설명했다.
3월에 출시된 32포트 시스템은 PAM4 변조를 사용하여 100 Gb/sec의 네이티브 라인 속도로 작동하며, 레인당 200 Gb/sec의 유효 대역폭을 달성한다. 이 아키텍처는 64, 128, 256포트로 확장 가능하다. OC-32M의 포트 간 지연 시간은 메인 메모리 속도인 10나노초(ns) 미만으로, Broadcom Tomahawk Ultra Ethernet ASIC의 약 250ns 및 기타 고성능 스위치의 450~650ns에 비해 현저히 낮다. 이는 Tomahawk Ultra 대비 25배 낮은 지연 시간을 의미한다.
재구성 시간은 MEMS 기반 OCS보다 3배 이상 빠르게 개선되었다. 포트당 에너지 소비량은 고속 이더넷 스위치 대비 두 가지 유형의 OCS 모두에서 8배 낮다. 잠재적 고객들은 현재 Nvidia와 AMD의 GPU 72개로 제한된 AI 시스템의 스케일업 영역을 확장하는 데 관심을 보이고 있다. 일부는 단일 랙을 넘어선 일관된 메모리 영역을 확장하고자 하며, 다른 기존 랙 규모 메모리 파브릭에 대한 대안을 원하거나 생성형 AI의 디코딩(decode) 단계에서 여러 머신을 연결하기 위한 저지연 솔루션이 필요한 곳도 있다. Salience Labs의 OCS는 최대 8개의 모듈을 단일 1U 샤시(chassis)에 패키징할 수 있다.