Google이 상용 Cloud TPU 서비스를 일반 공급을 위해 출시하여 맞춤형 AI 가속기를 클라우드 시장으로 가져옵니다.
Google은 최근 전년도 5월에 처음 발표한 Google Cloud TPU가 이제 Google Cloud Platform(GCP)에서 TensorFlow 기반 AI 애플리케이션 실행을 위해 제한된 수량으로 베타 서비스로 이용 가능하다고 발표했습니다. 검색 거대 기업은 이 기기가 자사의 데이터센터 발자국과 비용 지출을 상당히 줄일 것이라고 주장합니다. 그러나 64GB의 고비용 고대역폭 메모리(HBM)를 갖춘 이 4다이 제품은 NVIDIA의 1년 된 싱글칩 Tesla V100 GPU 가속기보다 성능 단위당 대략 33% 더 비쌉니다.
Google은 2017년 NVIDIA GTC 행사 1주일 후에 TensorFlow Processing Unit을 출시했습니다. 이 행사에서 그래픽 칩 제조업체는 거대한 Volta GPU를 공개했습니다. 머신러닝을 위한 ASIC(Application Specific Integrated Circuit)의 개념은 명확한 매력이 있습니다. 순수 성능 측면에서 칩 대 칩 비교를 하면, Cloud TPU 칩 자체는 초당 45조 연산(45 TOPS)을 제공합니다—이는 NVIDIA의 Pascal GPU 가속기 성능의 2배 이상입니다. 그러나 NVIDIA의 Volta GPU는 125 TOPS를 제공하므로, 약 3배 빠릅니다(125 vs. 45 TOPS). 이는 부분적으로 단일 클럭 사이클에 4x4 행렬 곱셈을 수행하는 TensorCore 기능 덕분입니다—모델이 이 기능을 활용할 수 있다면 말입니다.
가격 비교는 극명합니다: 4다이 Google Cloud TPU는 Amazon AWS 클라우드에서 이용 가능한 NVIDIA Volta GPU보다 2배 이상 비싼 반면, ResNet50 신경망의 훈련 시간을 기준으로 약 67% 더 높은 성능을 제공합니다. 결과적으로: Google 부품은 동일한 작업을 완료하는 데 약 33% 더 많은 비용이 듭니다. 4다이 Cloud TPU는 훈련을 더 빠르게 완료할 수 있지만, AWS의 4 GPU 인스턴스보다 2배 이상 느립니다. 높은 비용은 부분적으로 HBM2 메모리 칩에 의해 주도되는 것으로 보입니다. TPU 다이당 $300 이상으로 추정되며, 이는 Volta에 필요한 16GB 메모리보다 약 $900 더 많습니다.
Google은 또한 상호 연결된 TPU로 구성된 거대한 컴퓨팅 클러스터인 TPU Pods가 그해 말에 준비될 것이라고 발표했습니다. 회사는 이미 1000개의 TPU로 이루어진 TPU Pod(TensorFlow Research Cloud라고 불림)가 TensorFlow 기반 AI 모델 혁신을 촉진하기 위해 "세계 상위 연구자"에게 무료로 제공될 것이라고 발표했습니다. TPU 실리콘은 Google의 오픈소스 머신러닝 프레임워크인 TensorFlow만 지원하는 반면, NVIDIA의 GPU는 거의 모든 머신러닝 소프트웨어 패키지를 지원합니다. Google의 TPU 하드웨어는 Google 서비스를 통해서만 이용 가능합니다.
초기 발표로부터 9개월이 지나서야 TPU는 지금 "제한된 수량"의 베타 서비스로 이용 가능해졌습니다. 진정한 실망은 가격 책정 전략에서 비롯됩니다: 왜 누군가 동일한 작업을 완료하기 위해 더 많은 비용을 지불할까요? HBM2 메모리 가격 차이를 고려하더라도, Google은 제조 원가로 이 ASIC을 얻고 있으므로, 더 높은 가격책정은 부품 비용만으로는 완전히 설명될 수 없습니다. 고급 실리콘 개발은 어렵습니다—Google이라고 해도 말입니다—Google이 수량 제한의 원인이 되는 문제들을 해결하면 이 가격들이 내려올 것으로 기대됩니다.