Salience Labs开发GPU互连硅光子光学交换机技术,相比NVIDIA NVLink铜互连提供更高带宽和更低延时。
光路交换机在网络研究实验室和电信生产中已使用超过二十年,但如今正准备进入高性能计算集群的扩展网络领域。Salience Labs已开发了一款基于硅光子技术的光路交换机,源自创建光子计算平台的先进研究。
目前生产中的光开关有两种。基于MEMS的交换机采用微小机械镜阵列旋转以创建光纤电路,而硅液晶(LCoS)交换机则依赖不同的光学机制。自2015年以来,Google在其"Apollo" OCS骨干网中使用了称为"Palomar"的MEMS设备,使集群能够动态重新配置,支持相干内存集群中多达9,216个TPU。Lumentum销售基于MEMS的OCS设备并与英伟达合作,而Coherent提供基于LCoS的OCS设备,同样与英伟达合作。
Salience Labs未披露其具体的交换机制,但既不使用MEMS也不使用LCoS。该公司从牛津大学和明斯特大学分离出来,由牛津大学应用纳米材料教授Harish Bhaskaran和明斯特大学实验物理学教授Wolfram Pernice的研究基础创立——两位均为Salience Labs的联合创始人。他们的研究重点是相变光电子学。该公司与Tower Semiconductor的合作涉及PH18DA集成III-V激光器和TPS45PH低损耗硅氮化物波导,表明其可能在硅光子框架内使用相变技术。
首席执行官兼联合创始人Vaysh Kewada持有伦敦帝国理工学院物理学学士和硕士学位,曾担任牛津科学企业公司的驻场创业者——他拒绝详细说明确切的交换机制。该公司正推出32端口OCS,计划为扩展AI网络提供64、128和256端口系统。
区分Salience Labs方案的是速度。MEMS和LCS交换机需要毫秒级时间来重新配置端口间链接,而硅光子波导交换在300微秒以内完成。"我们选择开发OCS是因为有大量参与者在CPO、NPO、XPO领域开发解决方案,试图解决如何将数据从芯片传输到光纤的问题,"Kewada表示。"当数据中心建立更多光学连接时,我们思考交换架构的样貌。我们基于一个简单假设开发产品:数据中心中会有更多光学连接,当这种情况发生时,交换层将朝着更异构的架构发展——电分组交换和光路交换的组合。我们的观点是OCS是一个成熟待颠覆的市场,因为现今可用的OCS基于二十年甚至更古老的技术。"
Salience Labs的OCS包含两个芯片:一个完全集成的硅光子OCS和一个放大及信号调理芯片,类似于高带宽铜缆的再驱动器和重定时器。这两个芯片背对背安装在PCB卡上,该设计解决了硅光子的一个关键问题——光损耗。"一旦在芯片上集成,就会产生光损耗,"Kewada解释说。"我们使用自有组件设计的放大来解决这个问题,采用阵列制造以满足物料清单成本目标。这个放大芯片是独一无二的,是整个系统的关键。"
3月推出的32端口系统以100 Gb/sec原生线速率运行,采用PAM4调制,每条通道实现200 Gb/sec有效带宽。该架构可扩展至64、128和256端口。OC-32M的端口到端口延迟低于10纳秒——主存储器速度级别——相比之下Broadcom Tomahawk Ultra以太网ASIC约为250纳秒,其他高性能交换机为450-650纳秒。这代表比Tomahawk Ultra低25倍的延迟。
重新配置时间比基于MEMS的OCS快3倍或更多。与快速以太网交换机相比,每端口能耗低8倍。潜在客户有兴趣扩展AI系统的扩展域,目前仅限于来自英伟达和AMD的72个GPU。某些客户寻求将相干内存域扩展到单个机架之外,而其他客户需要现有机架级内存结构的替代方案或需要用于在生成式AI解码阶段连接多台机器的低延迟解决方案。Salience Labs的OCS可将多达八个模块封装到单个1U机箱中。