산업 분석에 따르면 클러스터 내 데이터 이동이 주요 성능 병목 현상으로 부상함에 따라 AI 네트워킹 장비가 핵심 성장 동력으로 부상하고 있다.
인공지능이 급속히 확장되고 있지만, AI 기업들의 주요 제약 조건은 곧 순수 칩 성능에서 인터커넥트 속도로 전환될 가능성이 높다. 시스템이 더욱 복잡해짐에 따라 프로세서 간 효율적인 통신 능력이 핵심 병목 현상으로 부상하고 있다.
이 같은 결론은 시티(Citi) 애널리스트들이 핫 칩스(Hot Chips) 컨퍼런스 발표 내용을 검토한 결과에 따른 것이다. 해당 검토는 점점 더 정교해지는 AI 아키텍처의 주요 성능 제한 요소로 네트워킹을 강조한다. 이러한 변화는 AI 인프라 관련 주식에 중대한 영향을 미친다. 시티에 따르면 엔비디아(Nvidia), 브로드컴(Broadcom), 아리스타 네트워크스(Arista Networks), 루멘텀(Lumentum), 코히어런트(Coherent), 마벨 테크놀로지(Marvell Technology), 아스테라 랩스(Astera Labs)는 고속이고 효율적인 데이터 이동에 대한 증가하는 수요를 활용하기에 잘 갖추어진 기업들이다.
이러한 진화는 더 넓은 산업적 전환을 시사한다. 초기 AI 인프라 경쟁은 점점 더 복잡한 모델을 학습하기 위해 더 강력한 GPU와 가속기를 확보하는 데 집중되었으나, 다음 단계에서는 효율적인 프로세서 간 연결이 우선시될 것이다. 초기 개발 주기는 단순했다: 컴퓨팅 용량을 극대화하는 것. 그러나 시스템이 확장됨에 따라 복잡성은 기하급수적으로 증가한다. 현대 모델은 막대한 매개변수 수, 광범위한 컨텍스트 윈도우, 그리고 정교한 AI 에이전트 워크로드를 갖추고 있어, 시스템 구성 요소 간 지속적인 대용량 데이터 전송을 요구한다. 데이터 전송을 기다리며 유휴 상태에 있는 고성능 칩은 최소한의 가치しか 창출하지 못한다. 따라서 네트워킹이 중요해졌다. AI 아키텍처는 대규모 데이터 센터 내 여러 존에 걸쳐 있더라도 GPU, 메모리, 서버, 랙 간 끊임없는 데이터 교환을 필요로 한다.
엔비디아(Nvidia), 브로드컴(Broadcom), 메타(Meta), 구글의 알파벳(Alphabet), 삼성(Samsung)의 발표들은 이러한 궤적을 강화한다. "미래의 AI 승자는 반드시 가장 빠른 프로세서를 가진 기업이 아니라, 전체 시스템 전반에 데이터를 가장 효율적으로 이동시킬 수 있는 기업일 것이다."라고 애널리스트들은 말했다. 이러한 패러다임 전환은 투자자의 관심을 차세대 AI 인프라 리더들로 이끌 수 있다. 엔비디아는 여전히 AI 컴퓨팅 분야에서 지배적인 힘을 유지하며, 그 GPU는 대부분의 현대 데이터 센터에서 중심적인 역할을 한다. 그러나 동사는 이러한 칩들을 연결하는 네트워킹 기술에 대한 강조도 동시에 확대하고 있다. 시티는 특히 엔비디아의 'AI 팩토리(AI factories)' 개념을 주목했는데, 이는 단순히 서버를 수용하는 것을 넘어 컴퓨팅, 메모리, 네트워킹, 스토리지, 보안 레이어 전반에 걸친 데이터 흐름을 최적화하도록 설계된 차세대 시설이다. 이러한 아키텍처는 브로드컴과 아리스타 네트워크스 같은 기업의 전략적 중요성을 높인다. 브로드컴은 대규모 배포를 위한 핵심 네트워킹 및 연결 솔루션을 공급하는 반면, 아리스타 네트워크스는 고속 스위칭 인프라에 특화되어 있다. 추가적인 참여자들은 보완적인 부문에서도 혜택을 받을 것으로 예상된다: 루멘텀과 코히어런트는 초고속 데이터 전송을 가능하게 하는 광기술을 제공하고, 마벨 테크놀로지는 연결성 및 데이터 인프라 제품을 개발하며, 아스테라 랩스는 프로세서, 메모리, 주변 장치 간 인터커넥트에 전문화되어 있다.
메모리 통합 또한 equally 중요하다. 네트워킹과는 구별되지만 두 가지 과제는 깊이 연관되어 있다. 처리 장치 근처에 데이터를 위치시키면 혼잡한 인터커넥트에 대한 의존도를 줄이고, 통신 오버헤드를 낮추며, 전체 시스템 효율성을 향상시킨다. 삼성(Samsung), XCENA, 세레브라스(Cerebras)를 포함한 기업들은 계산 엔진 근처에 데이터를 공동 배치하는 기술을 적극적으로 개발 중이다.
이러한 현실은 투자자들이 AI 인프라를 단편화된 부품들의 집합체가 아닌 통합된 생태계로 평가해야 함을 의미한다. 최고 수준의 GPU 성능만으로는 대규모 AI 배포의 효용성을 결정할 수 없다. 메모리 용량이 중요하다. 메모리 대역폭이 중요하다. 네트워킹 속도가 중요하다. 광학 연결이 중요하다. 이를 모두 제어하는 소프트웨어 역시 중요하다. 시티의 분석은 이것이 AI 인프라 환경에서의 중대한 전환점임을 강조한다. 따라서 AI 확장의 다음 단계는 이전 단계와 다를 가능성이 높다. 순수 프로세서 속도에 우선순위를 두기보다는, 자본 배분은 데이터 병목 현상으로 인한 지연을 제거하며 수천 개의 프로세서 간 원활한 조정을 가능하게 하는 기업들에게 점차 더 많이 집중될 것이다. 모델이 확장되고 데이터 센터가 흩어진 서버 클러스터에서 매우 최적화된 정보 이동 기계로 진화함에 따라, AI 네트워킹은 향후 가장 중요한 인프라 테마 중 하나로 부상할 준비가 되어 있다.