Amazon Web Services가 에이전틱 AI 수요 급증에 따른 EC2 낭비 감축 압박 속에서 CPU 사용량 제한 시행을 강화한다고 발표했다.
Amazon Web Services는 엔지니어들의 EC2 인스턴스 내부 사용을 단속하고 있습니다. 5월에 회사는 엔지니어들을 만나 CPU 낭비를 줄이고 AWS가 고객 수요를 충족할 충분한 CPU 용량을 확보하도록 지시했다고 The Information이 보도했습니다. 이 지시는 데이터 센터 경제학의 전례 없는 변화를 반영합니다: GPU와 CPU의 전통적인 8:1 또는 4:1 비율이 동등에 가까워지고 있습니다.
이전에 몇 시간이 걸렸던 것이 이제 며칠이 걸리고 있습니다. 엔지니어들은 이전에 몇 시간 내에 프로비저닝할 수 있었던 EC2 인스턴스에 접근하기 위해 며칠을 기다려야 한다고 보고합니다. 한 엔지니어는 The Information에 Amazon에서 수년간 근무한 후에도 인스턴스 대기 시간이 이렇게 길었던 적이 없다고 말했습니다.
EC2 인스턴스는 현대 인터넷의 상당 부분을 구동하며 클라우드 및 프라이빗 배포에서 모두 사용됩니다. 전통적으로 AWS 엔지니어들은 웹 인프라의 상대적으로 낮은 CPU 사용률을 활용하여 개발용으로 여러 가상 머신을 구동했습니다. 이러한 내부 압박은 전례 없는 외부 수요를 나타냅니다.
Amazon은 EC2에서 AMD, Intel, 그리고 더 최신의 Graviton5 칩을 포함한 여러 CPU 아키텍처를 배포합니다. Graviton5는 회사의 지금까지 가장 강력한 CPU이며, Nvidia의 Vera CPU 및 Arm의 자체 AGI와 유사한 Arm 기반 아키텍처를 사용합니다.
CPU 부족은 에이전트 AI 워크로드의 폭발적 성장에 의해 주도되고 있습니다. GPU 가속화인 전통적 추론과 달리, 에이전트 AI는 CPU에서 실행되는 복잡한 오케스트레이션 및 도구 호출을 포함합니다. 이는 CPU가 주로 GPU를 공급하기 위해 역할하던 이전 모델을 뒤집었습니다. 수요가 너무 강해서 Intel, AMD 및 기타 업체들은 고객들이 사용 가능한 모든 용량을 수용할 것이라고 보고합니다.
문제의 규모는 최근 사건에서 분명합니다. Amazon의 코딩 에이전트는 지난달에 $1.8백만의 토큰 비용을 소비했으며, 개발 예산을 860% 초과했습니다. AMD는 데이터 센터용 Zen 6 "Venice" CPU를 공개하여 대응했습니다. 이는 AMD가 수십 년 만에 클라이언트 시장보다 먼저 데이터 센터용 새로운 아키텍처를 출시한 것이 처음입니다. Nvidia는 유사하게 에이전트 AI 인프라 기회를 포착하기 위해 가속기로부터 새로운 Vera CPU로 메시징을 전환했습니다.
부족은 스팟 인스턴스에 집중되어 있는 것으로 보입니다. 한 컨설턴트는 The Information에 계약된 용량이 의미 있는 부족을 경험하지 않았다고 말했으며, 이는 Amazon의 내부 압박이 절대적 공급 제약이 아닌 수요 급증에서 비롯되었음을 시사합니다.
발행 이후 AWS 대변인은 다음과 같이 성명을 발표했습니다: "EC2를 포함한 AWS 서비스에 대한 수요는 믿을 수 없을 정도로 강하고 계속 증가하고 있습니다. 이렇게 높은 수요에도 불구하고, 우리는 내부 및 외부 고객 모두의 대다수 컴퓨팅 수요를 계속 충족하고 있습니다. 우리는 내부 팀과 긴밀히 협력하여 유휴 인스턴스 회수, 적절한 크기 조정, 필요에 따른 확대 및 축소와 같은 방식으로 EC2 리소스를 최대한 효율적으로 사용하도록 보장하면서 그들의 컴퓨팅 수요를 충족시킵니다—우리가 항상 해온 것처럼. 이러한 효율성은 내부 및 외부 고객 모두를 위한 용량을 관리하는 데 도움이 되며, 이러한 오랫동안 지속된 노력이 새로운 용량 제약을 반영한다는 제안은 단순히 잘못되었습니다. 이러한 전제는 선정적입니다. 검소함은 Day 1부터 우리 DNA의 일부입니다. 우리는 항상 팀들이 효율적으로 운영하도록 권장해 왔습니다. 우리는 또한 고객들이 리소스를 최적화하는 방법에 관한 모범 사례를 공유합니다. 이것은 새로운 지시가 아니며, 리소스의 효율적 사용을 권장하는 것은 Amazon에만 해당되지 않습니다."