인텔은 Hot Chips 2026에서 Xe3P 아키텍처 기반의 Crescent Island AI 가속기를 공개했으며, 이는 와트당 AI FLOPS를 극대화하기 위해 액체 냉각 칩을 활용한다.
Hot Chips 2026 심포지엄에서 인텔은 Xe3P 아키텍처를 기반으로 구축된 Crescent Island AI 가속기에 대한 더 깊은 아키텍처 통찰력을 공유했습니다. Nvidia의 Rubin과 AMD의 MI455X GPU는 AI 학습 및 추론 워크로드 전반에 걸쳐 최고 성능을 제공하기 위해 방대한 HBM4 메모리 풀에 의존하는 고전력 전용 액체 냉각 칩인 반면, Crescent Island는 AI 가속기 시장의 저전력 추론 우선 세그먼트를 타겟으로 합니다. 이 칩은 최대 480 GB의 LPDDR5X 메모리를 지원할 수 있는 350W 공기 냉각 PCIe 카드로 설계되어, 특수 전원 또는 냉각 인프라 없이도 기존 서버 환경에 배포될 수 있습니다.
Crescent Island은 각각 8개의 Xe 코어를 포함하여 총 32개의 Xe 코어를 갖춘 네 개의 Xe3P 슬라이스로 구성됩니다. 각 Xe 코어에는 8개의 Xe 벡터 엔진과 8개의 XMX 매트릭스 가속기가 통합되어 있어, 전체 다이(Die)에 걸쳐 총 256개의 벡터 엔진과 256개의 XMX 유닛이 구현됩니다. 이러한 연산 자원을 유지하기 위해 인텔은 캐시 계층 구조를 대폭 확장했습니다. 각 Xe 코어는 이제 일반 목적 레지스터 파일 공간 1 MB를 특징으로 하며, 이는 Battlemage 및 Xe2 아키텍처에서 발견된 512 KB 용량의 두 배입니다. 또한 Xe3P는 Xe 코어당 512 KB의 L1 캐시 또는 공유 로컬 메모리를 제공하며, 이는 Battlemage의 256 KB보다 증가한 수치이고 Panther Lake의 Xe3 GPU 대비 약 1.33배 증가한 것입니다. 이 칩은 32 MB의 공유 L2 캐시를 포함하고 있으며, 모두 칩의 더 큰 매트릭스 가속기에 효율적으로 데이터를 공급하도록 설계되었습니다.
주요 아키텍처적 진보는 16단계 심플렉틱(Systolic) 설계를 활용하는 XMX 엔진에 있습니다. 이를 통해 칩은 Xe2 및 Xe3에서 사용된 4단계 심플렉틱 설계보다 훨씬 더 큰 단위로 매트릭스를 처리할 수 있습니다. Nvidia는 Tensor Cores와 관련된 비교 가능한 아키텍처 세부 사항을 공개하지 않지만, 이러한 증가된 병렬성은 AI 추론 중 동시 매트릭스 곱셈 연산에 의미 있는 기능 향상을 제공합니다. 인텔은 FP4 형식부터 마이크로 스케일링(MXFP4)을 지원하는 것부터 Xe 코어당 64개의 FP64 FMA 유닛을 통한 완전 속도 더블 정밀도 컴퓨팅까지 광범위한 데이터 타입 지원을 우선시했습니다. FP64는 표준 AI 워크로드에서 거의 사용되지 않지만, 인텔은 완전 속도 지원이 Crescent Island를 고성능 컴퓨팅과 AI 애플리케이션 모두를 위한 실행 가능한 수렴 플랫폼으로 위치시킨다고 밝혔습니다. 각 Xe 코어는 소프트맥스 같은 연산에 중요한 시그모이드 및 탄헨트 초월 함수도 지원하며, 이는 최근 AMD와 Nvidia가 자체 AI 중심 아키텍처에서 강조한 기능과 일치합니다.
Crescent Island는 멀티모달 AI 모델의 비디오 처리를 돕기 위해 4개의 인코더와 디코더를 갖춘 미디어 코덱 블록을 포함합니다. 그러나 이 칩은 다이 면적을 연산 기능에 최대한 확보하기 위해 레이 트레이싱 코어와 같은 그래픽 특정 기능을 의도적으로 생략했으므로, 향후 소비자용 Arc 그래픽 제품의 기반이 되지는 않을 것입니다. 데이터센터 등급의 구성 요소로서, 이 칩은 다이 전반에 걸친 ECC 및 패리티 보호를 비롯한 다양한 메모리 신뢰성 메커니즘과 함께 포괄적인 신뢰성, 가용성 및 서비스성(RAS) 기능을 갖추고 있습니다.
인텔은 특히 전문가 혼합(Mixture-of-Experts) 모델과 예측 디코딩(Speculative Decoding)의 결합을 주요 타겟 워크로드로 강조합니다. 예측 디코딩은 메인 모델이 나중에 받아들이거나 거부하는 초안 토큰을 생성하기 위해 경량 메커니즘을 사용하여 전체 디코딩 효율성을 개선합니다. CPU의 예측 실행과 마찬가지로, 이 접근 방식은 모든 초안 토큰이 승인되지는 않더라도 그렇지 않으면 유휴 상태일 자원에서 유용한 연산을 추출합니다. 모델 서빙 전략이 더 공격적인 드래프팅 기법을 채택함에 따라, 이러한 초안을 생성하기 위한 연산 요구량이 증가하여 전통적으로 주로 메모리 대역폭 제한 작업으로 여겨지던 디코딩을 연산 집약적 작업으로 인식하게 만듭니다. Crescent Island는 HBM 대신 LPDDR5X에 의존하므로 전통적인 자기회귀 디코딩에 대해 경쟁 가속기들의 극한의 대역폭을 갖추지 못했습니다. 따라서 스루풋을 극대화하기 위해 예측 디코딩을 활용하는 것이 필수적입니다.
인텔은 Crescent Island가 와트당 높은 FLOPS를 위해 설계되었으며, 특히 프롬프트 처리 및 KV 캐시 구축과 같은 프리필l 연산 등 AI 추론의 연산 집약적 단계에 최적화되었다고 강조합니다. 이러한 초점은 디코딩 집약적 워크로드에 더 적합한 HBM 기반 가속기와 함께 보완적인 역할을 수행할 것임을 시사합니다. 이러한 분리형 접근 방식은 GPU 기반 프리필l 처리를 활용하도록 명시적으로 설계된 SN50 추론 가속기를 보유한 SambaNova와의 파트너십과 같은 협력 관계에 혜택을 줄 수 있습니다. SN50 랙과 Crescent Island 모두 기존 데이터 센터에 주요 인프라 업그레이드 없이 배포할 수 있는 저전력 공기 냉각 시스템으로 positioning되어 강력한 생태계 시너지를 창출합니다. 인텔은 아직 구체적인 이론상 FLOPS나 메모리 대역폭 수치를 공개하지 않았지만, 전력 한계 내에서 데이터를 연산 엔진 근처에 유지하고 더 큰 배치로 처리하는 아키텍처 전략은 여러 차례의 유명 제품 실패와 취소 이후 AI 야망을 재설정하려는 회사의 노력에 전략적으로 타당해 보입니다. Crescent Island는 2026년 하반기 출시 예정이며, 업계 관찰자들은 출시 시 최종 사양과 초기 고객 도입 지표를 기다리고 있습니다.