AMD는 에이전트 AI 추론 워크로드의 비용 상승에 대한 솔루션으로 분산 컴퓨팅을 포지셔닝하고 있습니다.
기술 회사 AMD는 에이전트 AI 도입이 토큰 소비와 클라우드 컴퓨팅 비용을 증가시키면서 기업들이 컴퓨팅 인프라를 재고려할 것을 촉구하고 있으며, 비용 관리 솔루션으로 분산형 AI 아키텍처를 제시하고 있습니다.
자율 AI 에이전트들이 파일럿 프로젝트를 넘어 부서 워크플로우로 확대되면서, 지속적인 운영으로 인한 사용량 기반 비용이 크게 증가하고 있습니다. AMD의 아시아 태평양 지역 총괄 매니저인 Alexey Navolokin은 "AI가 일회성 프롬프트에서 에이전트 AI를 통한 지속적 워크로드로 전환되면서, 토큰 소비가 빠르게 증가할 수 있습니다. 시스템이 반복적으로 추론하고, 도구를 호출하며, 재시도하는 과정에서 말입니다"라고 설명했습니다. "각 단계마다 컴퓨팅과 시스템 오버헤드가 소비되며, 클라우드 환경에서는 사용량 기반 비용이 누적될 수 있습니다."
Anthropic의 2026 AI 에이전트 현황 보고서에 따르면, 조사 대상 기업의 57%가 이미 다단계 워크플로우를 위해 에이전트를 배포하고 있습니다. Navolokin은 기업들이 단순히 업무를 자동화하기보다는 직원들의 역량을 강화하기 때문에 에이전트를 도입하고 있다고 지적했습니다. "AI 에이전트는 인간의 업무를 단순히 대체하기보다는, 직원들이 달성할 수 있는 것을 배가시킵니다. 에이전트는 지속적으로 운영되고, 반복적 작업을 처리하며, 개인이 감당하기 어려운 규모와 속도로 여러 단계를 조정할 수 있고, 직원들은 의사결정, 창의성, 도메인 전문성, 책임성에 집중할 수 있습니다." 소규모 비즈니스는 팀을 지원하기 위해 에이전트를 활용할 수 있고, 창작자는 일정 관리와 콘텐츠 배포를 위임할 수 있으며, 전문가들은 연구와 종합을 위해 사용할 수 있습니다. AMD 내에서는 에이전트가 이미 반도체 설계에 배포되어 문제 식별과 해결을 가속화하고 있습니다.
AMD는 기업들이 클라우드 인프라에만 의존하는 것을 재고려해야 할 수도 있다고 주장합니다. Navolokin은 "에이전트 AI는 분산형 인프라 과제이며, 클라우드, 데이터 센터, 엣지, AI PC에 걸쳐 적절한 컴퓨팅의 조합이 필요합니다"라고 말했습니다. 분산형 AI 아키텍처는 어떤 단일 환경도 모든 워크로드에 최적이 아니기 때문에, 클라우드, 데이터 센터, 엣지 시스템, AI 지원 PC에 걸쳐 워크로드를 지원합니다.
기업들은 특정 AI 워크로드에 가장 효율적이고 비용 효과적인 인프라를 결정하는 "워크로드 적정 크기 조정"을 실천해야 합니다. Navolokin은 "빈번하거나 지연 시간에 민감한 워크로드는 로컬 또는 엣지 컴퓨팅의 혜택을 받을 수 있으며, 더 큰 규모이거나 매우 탄력적인 워크로드는 계속 클라우드를 사용할 수 있습니다"라고 말했습니다. AI PC에서 일부 워크로드를 로컬로 실행하면 반복적인 추론 비용을 줄일 수 있으며, 초기 하드웨어 비용을 회피할 수 있는 클라우드 토큰 요금으로 상쇄할 수 있습니다.
AMD의 분석에 따르면, 사용자당 하루 570만 개의 입력 토큰과 574,000개의 출력 토큰의 중간 워크로드 계층에서, 50% 로컬 및 50% 클라우드 구성으로 운영되는 500대의 AMD AI PC 함대는 클라우드 전용 배포 대비 40% 이상 60% 이하의 3년 절감액을 생성할 수 있습니다. 이 워크로드는 Claude Code, Codex, Hermes와 같은 에이전트 도구를 적극적으로 사용하는 지식 근로자를 나타냅니다. AMD는 완전한 로컬 배포가 더 높은 절감액을 생성할 수 있으며, 초기 투자는 일반적으로 24개월 이내에 손익분기점에 도달할 것으로 추정했습니다.
AMD PRO R9700 데스크톱 구성은 하루 약 1,800만 개의 AI 사용 토큰을 지원할 수 있으며, 전기 비용은 월 약 $64.80입니다. AMD의 비교 가정에 따르면, 이 구성의 3년 비용은 $6,533인 반면, 클라우드 기반 사용의 경우 $81,108입니다. 실제 비용은 워크로드, 클라우드 모델, 하드웨어 활용률, 전기 요금, 배포 구성에 따라 달라집니다.
AI PC 기능 및 소규모 언어 모델의 개선으로 더 많은 AI 워크로드를 로컬에서 처리할 수 있게 되고 있습니다. Navolokin은 "AI PC는 직원, 데이터, 워크플로우가 실제로 존재하는 곳에 AI 컴퓨팅을 더 가깝게 가져오기 때문에, 점점 더 AI 인프라 투자로 간주되고 있습니다"라고 말했습니다. "충분한 메모리와 컴퓨팅 능력을 갖춘 로컬 시스템은 도구 호출, 콘텍스트 풍부한 워크플로우, 멀티에이전트 애플리케이션을 지원하는 모델을 실행할 수 있으며, 기업이 클라우드 서비스로 보내야 하는 추론량을 줄일 수 있습니다. 이는 반복적인 클라우드 추론 비용을 낮추면서도 낮은 지연 시간과 민감한 데이터 처리 위치에 대한 더 큰 통제력을 제공합니다." 로컬 처리는 에이전트가 엔터프라이즈 애플리케이션 및 독점 정보와 점점 더 많이 상호 작용함에 따라 AI 거버넌스를 강화할 수 있으며, 조직이 민감한 워크로드를 온프레미스에 유지할 수 있도록 합니다.
분산형 AI 아키텍처로의 전환은 기업들이 자신들의 기술 스택을 재고려하도록 요구합니다. Navolokin은 "가장 큰 과제는 비용, 데이터 제어, 인프라 기능 간의 균형을 맞추는 것입니다"라고 말했습니다. "로컬 AI는 또한 충분한 메모리, CPU, GPU 용량, 보안, 소프트웨어 지원을 포함한 올바른 인프라를 필요로 합니다." 에이전트 AI는 또한 단일 직원이 결국 여러 에이전트를 동시에 운영할 수 있기 때문에 기업의 용량 요구 사항을 변경할 수 있습니다. Navolokin은 "하나의 직원이 여러 에이전트를 관리하면 전통적인 AI 어시스턴트보다 컴퓨팅, 메모리, 데이터 접근, 오케스트레이션에 대한 훨씬 더 많은 동시 수요를 생성할 수 있습니다"라고 지적했습니다. "이는 기업들이 GPU 성능만에 초점을 맞추기보다는 CPU, GPU, 메모리, 네트워킹, 소프트웨어 전반에 걸쳐 균형잡힌 인프라를 계획해야 함을 의미합니다."
기업들은 에이전트 AI 기술이 진화함에 따라 유연성을 구축해야 합니다. Navolokin은 "개방형 소프트웨어 생태계는 팀이 로컬에서 개발하고, 규모에 따라 테스트하며, 가장 의미 있는 곳에 워크로드를 배포할 수 있게 하면서, 에이전트 AI가 진화함에 따라 종속성을 줄일 수 있습니다"라고 말했습니다. "AMD에서 우리의 접근 방식은 데이터 센터, 엣지, AI PC에 걸쳐 있는 개방형 생태계 포트폴리오를 제공하고, 고객이 AI 배포가 진화함에 따라 유연성을 제공하는 개방형 소프트웨어 및 표준으로 지원하는 것입니다."