Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

Intel과 AMD가 ACE CPU 확장 기능을 출시하여 x86에 AI 최적화 명령어 집합을 추가하고 행렬 연산 효율을 개선했다.

CPU 측 AI 역량 업그레이드가 가속화되어 추론 효율성 옵션을 강화할 수 있으며, GPU를 넘어선 컴퓨팅 경쟁이 심화되고 있다.
업계 전문지Slicast · 2026년 6월 20일 12:00 UTC · 글로벌 · 출처: Tom's Hardware
중요도 70

x86 CPU에서 AI 모델 실행이 더 쉬워지고 빨라지고 있습니다

"AI 모델 실행"에 관한 대부분의 논의는 어떤 형태의 GPU를 포함하지만, 모든 AI 작업이 이 하드웨어에 적합한 것은 아닙니다. 소규모 모델이나 지연시간에 민감한 단일 사용자 작업의 경우 GPU와의 데이터 왕복 오버헤드를 피할 수 있기 때문에 CPU에서 실행하는 것이 더 유리합니다. 또한 GPU를 전혀 사용할 수 없거나 성능이 제한된 통합 칩만 접근 가능한 많은 시나리오가 있습니다. Intel과 AMD는 최근 ACE CPU 확장에 대한 포괄적인 사양을 공개했으며, x86 프로세서에서 이러한 AI 작업을 더 쉽고 에너지 효율적으로 실행할 수 있게 했습니다.

ACE는 기존 AVX10 레지스터를 활용하면서도 행렬 곱셈을 위한 전용 실리콘을 추가하는 기술 표준을 제공합니다. 이는 여러 이점을 제공하지만, 주요 장점은 향상된 전력 효율성, 더 간편한 개발 및 최적화, AVX의 512비트 연산을 활용할 수 있다는 점입니다. 후자는 ACE 전용 입력을 요구하지 않음으로써 기존 설계와의 통합을 더 용이하게 합니다.

행렬 곱셈은 AI 워크로드의 핵심입니다. 숫자 표를 취하고 그 위에 곱셈-누적 사이클을 실행하는 것입니다. 이는 속도가 제한적이지만 항상 대부분의 CPU에서 가능했습니다. 오늘날에도 이러한 사이클을 실행하면 상당한 전력을 소비하며, x86의 AVX10 곱셈-누적 명령어를 활용하더라도 마찬가지입니다. 기술적으로는 AVX가 2D 행렬 곱셈 연산을 고려하여 설계되지 않았기 때문에 이는 임시방편입니다.

동일한 수의 입력 벡터에 대해 ACE는 AVX10과 비교하여 16배 더 많은 연산을 수행할 수 있습니다. 다만 이것이 반드시 16배의 속도 향상으로 이어지는 것은 아니며, 이는 특정 구현에 따라 다릅니다. 하지만 Intel과 AMD가 향후 설계에서 성능을 개선하기 위해 이 작업에 더 많은 실리콘을 할당할 것으로 예상하는 것이 합리적입니다. 또한 각 ACE 명령어가 해당 AVX10 루프보다 더 많은 작업을 수행하기 때문에 CPU 명령어 오버헤드가 적으며, RAM 대역폭 활용도 더 효율적일 수 있습니다.

이점은 동일한 작업을 위해 더 적은 명령어를 사용하는 것 이상으로 확장됩니다. ACE는 구현에 독립적으로 설계되었으므로 ML 프레임워크와 그 기본 라이브러리(PyTorch, TensorFlow)는 기본 하드웨어 및 AVX 지원 수준에 따라 여러 변형을 유지하기보다는 하나의 코드 경로만 작성하면 됩니다.

ACE는 ML 연산에 사용되는 거의 모든 데이터 타입(INT8, INT32, FP8, FP16, FP32, BF16 포함)을 기본적으로 지원하며, AVX10이 제공하지 않는 Open Compute Project의 MX 블록 스케일링 포맷도 기본적으로 사용할 수 있습니다. 또한 개발자는 특정 작업의 빠른 완료가 필요할 때 일부 NPU별 워크로드를 다시 CPU로 오프로드할 수 있습니다. 이러한 시나리오에서 모든 NPU가 서로 다르다는 사실을 대처할 필요가 없다는 것은 큰 장점이며, ACE가 x86 하드웨어 내에서 일관된 대상을 제공하기 때문입니다.

원문 보기
Intel과 AMD가 ACE CPU 확장 기능을 출시하여 x86에 AI 최적화… · Slicast