Nvidia의 Blackwell B200은 FP4 정밀도를 사용하여 MLPerf 벤치마크에서 H100 대비 4배 성능 개선을 달성했다.
Nvidia는 Blackwell B200 프로세서에 대한 첫 번째 MLPerf 4.1 결과를 발표했으며, 단일 Blackwell GPU가 Hopper 아키텍처 기반의 H100 선대 프로세서보다 최대 4배의 성능을 제공함을 시연했습니다. Nvidia의 결과에 따르면 B200은 서버 추론 테스트에서 단일 GPU당 초당 10,755개의 토큰을, 오프라인 참조 테스트에서 초당 11,264개의 토큰을 달성합니다. 공개 MLPerf Llama 2 70B 벤치마크 결과는 4-way Hopper H100 기반 머신이 유사한 성능을 달성함을 보여주며, 이는 단일 Blackwell 프로세서가 단일 Hopper H100 GPU보다 약 3.7배~4배 빠르다는 Nvidia의 주장을 지지합니다. 그러나 이 비교의 타당성에 영향을 미치는 여러 중요한 경고 사항이 있습니다.
두 프로세서 간의 성능 차이는 여러 기술적 요인에서 비롯됩니다. 가장 중요한 점은 Nvidia의 Blackwell 프로세서가 5세대 Tensor Cores에서 FP4 정밀도를 사용하는 반면, Hopper 기반 H100은 FP8만 지원하고 사용한다는 것입니다. MLPerf 지침이 이러한 다양한 형식을 허용하지만, Blackwell의 FP4 성능은 FP8 처리량의 2배로, 비교에서 근본적인 이점을 나타냅니다. 또한 Nvidia는 단일 B200을 4개의 H100 GPU와 비교했는데, 스케일링이 결코 완벽하지 않고 단일 GPU 결과가 GPU당 성능의 최상의 경우를 나타내는 경향이 있으므로 다소 불공정한 짝이라고 할 수 있습니다.
아키텍처상 차이는 메모리 사양과 용량까지 확장됩니다. 테스트된 B200 GPU는 180GB의 HBM3E 메모리를 탑재했으며, H100 SXM은 80GB의 HBM (일부 구성에서 최대 96GB)을 가지고 있고, H200은 96GB의 HBM3에서 최대 144GB의 HBM3E를 가지고 있습니다. 96GB HBM3를 탑재한 단일 H200을 테스트했을 때 오프라인 모드에서 초당 3,114개의 토큰만 달성했지만, 더 큰 메모리를 탑재한 단일 H200은 초당 4,488개의 토큰을 달성했습니다. 이는 B200이 H200과의 비교에서 단지 2.5배만 빠르다는 것을 의미하며, 이는 Nvidia의 헤드라인 주장보다 훨씬 겸양적인 향상입니다.
141GB의 HBM3E 메모리를 탑재한 H200은 Llama 2 70B를 특징으로 하는 생성형 AI 벤치마크에서뿐만 아니라 데이터센터 카테고리의 모든 단일 테스트에서 뛰어난 성능을 발휘했으며, 해당 이점을 활용하는 테스트에서 더 큰 메모리 용량의 이점을 크게 누렸습니다. 주목할 점은 Nvidia가 총 9개의 핵심 분야를 포함하는 MLPerf 4.1 내에서 Llama 2 70B 생성형 AI 벤치마크에 대해서만 B200 성능 데이터를 공유했다는 것입니다. 이 제한된 공개가 지속적인 튜닝 노력이나 기타 요인을 반영하는지 여부는 불명확하지만, 다른 8개의 테스트 카테고리 전반에 걸친 Blackwell B200의 전체 성능은 아직 알려지지 않았습니다.