2026年9月11日星期五
AI 基础设施 · 新闻与分析
首页芯片与硬件报道
芯片与硬件 · 报道

思科与英伟达合作的Secure AI Factory扩展至包含Supermicro的机架级系统,以满足更大规模的AI集群需求。

此举为超大规模部署标准化了多供应商机架架构,加速了GPU云平台的集群交付并降低了集成摩擦。
行业媒体Slicast · 2026年8月30日 · 全球 · 来源: ServeTheHome
重要度 75

周,思科宣布其与英伟达合作的Secure AI Factory正在扩展至基于超微(Supermicro)液冷和风冷系统的机架级基础设施。该设计以符合英伟达云合作伙伴参考架构为基础,整合了思科验证基础架构服务(CVIS)、思科AI网络以及统一运营体系。思科计划将其参考架构、网络设备、验证服务和管理软件与超微的机架级系统相结合,并通过其企业销售和渠道合作伙伴生态系统于10月推出。思科的支持和生命周期服务将与硬件捆绑提供,同时包括公司的以太网硅片、光模块、安全及可观测性产品组合。

该参考设计将网络划分为两个交换机系列。前端网络运行在由思科Silicon One驱动的Cisco N9300系列交换机上,而后端网络则采用基于英伟达Spectrum-X硅片的Cisco N9100系列交换机。思科将该架构定位为适用于规模从约1,000个GPU到超过10万个GPU的集群,并直接映射到英伟达用于Vera Rubin和Grace Blackwell的NVL72构建、用于Rubin和B300的HGX NVL8系统以及MGX PCIe GPU平台。

思科按规模对其验证过的设计进行了细分。企业参考架构针对使用思科Silicon One N9300系列交换机的约1,000个GPU以下的AI服务器集群;而云参考架构则覆盖从约1,000个到超过10万个GPU的范围,将N9300前端与搭载英伟达Spectrum-X硅片的N9100系列后端相结合。这些专注于超微的部署定位在思科现有的Unified Edge和AI POD产品之外,主要针对模型训练和万亿参数负载,而非边缘推理或优化。

CVIS作为构建的操作骨干发挥作用。CVIS工具包处理可重复的配置和自动验证,而由专家主导的交付确保了带有性能和合规报告的完全验证集群的移交。专用的CVIS性能集群进一步支持软件测试和工具开发。对于物理维护,例如在超微服务器中更换SSD或GPU,超微将负责直接的硬件服务。

计划的超微产品线涵盖了英伟达加速计算产品组合的很大一部分,包括超微MGX系统、风冷和液冷的英伟达HGX B300 NVL8构建、英伟达HGX Rubin NVL8、Vera Rubin NVL72、GB300 NVL72机架级系统以及思科的UCS X-Series模块化服务器。在机架级别,网络触及集群中的每个网络结构。管理网络通过带有思科Silicon One的N9364E-SG2-O交换机连接,而前端和后端网络则利用带有英伟达Spectrum-X硅片的N9164E-NS4-O。思科表示,这种相同的网络配置可以使用网络团队已经熟悉的运营模式扩展到超过10万个GPU。

统一管理汇聚于计划在2026日历年第四季度发布的Cisco Cloud Control。控制台提供统一登录、库存、拓扑跟踪、服务器管理、基础设施电源和冷却监督以及网络管理,将Intersight和Nexus One整合为单一的Day 0–2操作模型。操作员可以获得整个AI集群的全面视图,Cloud Control呈现集群网络、前端/后端/存储/管理交换机、服务器和存储。集成的AI Canvas提供持续的可见性和简化的故障排除。

思科正用其专有的网络、经过验证的架构、销售渠道、支持、生命周期服务和管理层来包裹超微的机架级AI基础设施。这一合作消除了标准化使用思科网络的企业分别集成超微硬件、第三方交换机和不同管理工具的需求。关于此次合作的战略理由,主编Patrick Kennedy指出:“超微拥有大规模的AI集群业务,包括所有集成、测试和部署设施。他们的新一代服务器开发周期也比思科UCS快得多,这对于世代更替更快的AI基础设施至关重要。我问过思科关于机架外组件如冷水机、行内CDU等是否可用,听起来它们将通过经销商协议提供,但需要额外的工程工作,而不仅仅是交付一个机架。”

阅读原文