반도체·하드웨어 · 리포트
Together AI가 HPC 텐서 라이브러리인 ThunderKittens을 NVIDIA의 Vera Rubin GPU를 위해 최적화했으며, 새로운 가속기에서 워크로드 효율성을 향상시켰다.
GPU 클라우드 공급자의 소프트웨어-하드웨어 공동 최적화는 NVIDIA의 아키텍처 포트폴리오 확장에 따라 컴파일러 작업을 통한 경쟁 차별화를 보여준다.
업계 전문지Slicast · September 12, 2026 · 미국 · 출처: TipRanks
중요도 25Together AI는 NVIDIA의 새로운 Vera Rubin NVL72 플랫폼에서 실행되도록 ThunderKittens GPU 커널 프레임워크를 업데이트했습니다. 아키텍처에 대한 조기 접근권을 획득한 회사의 커널 팀은 새로운 명령어 집합을 탐색하고 NVFP4 및 FP8 GEMM 지원을 구현했습니다.
더 넓은 행렬 곱셈-누적 단계, 더 큰 텐서 및 공유 메모리, 더 깊은 파이프라인, 개선된 수집기 동작을 포함한 최적화 기법을 통해 NVFP4 커널은 22 PFLOPS 이상의 성능을 달성했습니다. 회사의 LinkedIn 게시물에 따르면, 이 성능 수준은 ThunderKittens를 핵심 선형대수 작업 부하를 위한 NVIDIA의 cuBLAS 및 CuTe 도메인 특화 언어와 경쟁력 있는 범위에 놓습니다.
Together AI는 NVIDIA의 Blackwell 및 Vera Rubin 아키텍처 간의 기술적 차이와 이러한 성능 수준에 도달하기 위해 필요한 특정 최적화를 문서화했습니다. 이 작업은 Together AI의 소프트웨어 스택을 차세대 NVIDIA 하드웨어와 긴밀하게 정렬하도록 배치하여, 고성능 AI 인프라에서 회사의 역할을 강화할 가능성이 있습니다. 첨단 GPU 클러스터에서 작업 부하를 최적화하는 엔터프라이즈 고객들의 경우, NVIDIA 자체 라이브러리와의 경쟁력 있는 성능 동등성은 효율적인 모델 훈련 및 추론에서 Together AI의 시장 기회를 확대할 수 있습니다.