AMD, Zen 6 기반 256코어 EPYC CPU 'Venice' 발표: L3 캐시 1024MB, 16채널 메모리, 5+ GHz 클럭
AMD는 1년 이상 teasers를 이어온 끝에 첫 Zen 6 CPU에 대한 세부 사항을 마침내 공개했다. Epyc 9996은 Zen 6 아키텍처 기반으로 구축된 256코어/512스레드 칩으로, AMD가 '폭넓은 포트폴리오'라고 묘사하는 Venice의 플래그십 출시를 대표한다. 이 회사는 Nvidia의 차기 Vera와 Intel의 Xeon 6 대비 상당한 성능 우위를 점하며, 향후 1년 동안 목적별 맞춤형 설계로 Venice 라인업을 확장할 계획이다.
"단일 프로세서가 아닙니다,"라고 AMD 컴퓨팅 및 엔터프라이즈 솔루션 담당 상무이사 Ravi Kuppuswany는 말했다. "이는 포트폴리오입니다." 이 전략은 Intel이 Xeon 라인업을 세분화하고 AMD가 Epyc 제품을 부드럽게 차별화해 온 방식과 유사하며, 일률적인 접근법보다는 특정 애플리케이션에 최적화된 솔루션을 제공한다.
주요 Venice 라인업은 SP7 소켓에서 출시되며, 고속 MRDIMM 사용 시 메모리 대역폭 1.6 TB/s와 단일 프로세서 구성에서 PCIe 6 레인 128개(듀얼 프로세서 시 160개)를 지원하며 최대 256코어/512스레드까지 확장된다. 256코어 구성은 AMD의 Zen 6c '고밀도' 설계를 사용한다. 표준 Zen 6 Venice는 128코어/256스레드까지 확장되며, 고주파수 변형 모델은 최대 96코어로 제한된다.
추가 구성도 계획되어 있다. 2027년 상반기에 출시될 SP8 소켓용 Venice는 소규모 배포를 위해 최소 8코어부터 최대 128코어까지 제공하며, 채널당 DIMM 2개를 지원하는 8채널 메모리와 동일한 128개의 PCIe 6 레인을 지원한다. Venice-X는 2027년 하반기 SP7 소켓에서 출시될 예정이며, 96코어와 최대 1,152 MB의 스택드 L3 캐시를 갖추고 최대 5.15 GHz까지 클럭될 수 있다. Verano는 2027년 하반기 SP8 소켓에서 출시되어 AI 워크로드를 타겟으로 하며, 최대 72코어와 5 GHz 피크 클럭을 제공하고 SOCAMM2 모듈을 활용한 24채널 LPDDR5X 메모리 시스템을 활용한다.
Venice의 메모리 아키텍처는 상당한 업그레이드를 의미한다. SP7 구성은 12,800 MT/s로 작동하는 MRDIMM 또는 8,000 MT/s의 표준 DDR5 RDIMM을 사용한 16채널 메모리까지 확장되며, 이는 6,400 MT/s RDIMM을 사용한 Turin의 12채널 메모리보다 큰 도약이다. AMD는 소켓당 대역폭이 1.6 TB/s로, Vera의 1.2 TB/s보다 훨씬 높으며 Turin의 소켓당 576 GB/s 대역폭의 거의 세 배에 달한다고 주장한다. Intel은 최근 일부 Granite Rapids 및 Clearwater Forest SKU에서 8,000 MT/s RDIMM을 활성화했으며, 2027년 1분기에는 최대 8,800 MT/s의 MRDIMM 지원을 계획 중이다.
Zen 6은 TSMC의 N2 공정을 기반으로 한다. AMD는 CCD당 32코어와 두 개의 IOD를 확인했다. 256코어 구성에는 1,024 MB의 L3 캐시가 포함되어 있어 Epyc 9965의 거의 세 배에 달하며, 각 CCD는 128 MB의 L3에 접근할 수 있고 코어당 4 MB를 할당받는데, 이는 Turin의 할당량보다 두 배 많다. 이는 스택드가 아닌 일반적인 캐시이며, 스택드 캐시는 Venice-X에서 도입된다.
AMD의 벤치마크 결과는 에이전트 AI 워크로드에 초점을 맞추고 있으며, 여기에는 높은 동시성 네트워킹, 코드 컴파일, 미디어 처리 등 다양한 작업이 포함된다. 이전 세대 Epyc 9965(192코어 Zen 5 밀집 설계) 대비 NGINX 및 WRK 로드 생성기를 사용한 프론트엔드 연산에서 Epyc 9996은 1.2배의 개선을 주장한다. Intel의 Xeon 6980P와 비교하면 동일한 테스트에서 성능이 2.8배 향상된다.
TPCx-AI 벤치마크(분당 AI 사용 사례)로 측정되는 데이터 중심 AI 워크로드에서 AMD는 세대 간 1.7배 개선과 Xeon 6980P 대비 3.4배 향상을 주장한다. Meta의 FAISS 라이브러리를 사용한 벡터화된 워크로드에서는 세대 간 1.6배 개선과 Intel 대비 2.3배 향상을 보인다. TPC-H, TPC-C, Redis를 포함한 엔터프라이즈 도구에서는 여러 테스트의 기하평균 처리량을 기준으로 세대 간 1.6배 개선과 Intel 대비 2.6배 향상을 보고한다.
다섯 가지 다른 에이전트 페르소나를 사용한 직접 에이전트 테스트에서는 세대 간 1.5배 개선과 Xeon 6980P 대비 2.5배 향상을 보였다. AMD는 GNU 15.2 컴파일러를 사용하여 두 시스템 모두 600W TDP로 Nvidia의 Vera와 직접 비교했다. SPEC CPU 2026 처리량(SPECrate integer suite)에서 256코어 밀집 Venice 설계는 Vera 대비 2.2배 향상을 주장한다. 96코어 고주파수 Venice 변형 모델은 Vera 대비 코어당 성능이 1.2배 향상된다고 주장한다. SPEC CPU 2017(SPECrate integer)에서 Venice는 Intel의 Xeon 6980P 대비 2배의 처리량을 달성하며, Arm의 신규 AGI 대비 코어당 성능은 1.3배이다.