Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

AMD가 AI 모델 가중치를 실리콘에 직접 식각하여 추론 가속화를 구현하는 토론토 기반 스타트업 Taalas의 인수를 발표했다.

AMD는 AI 추론 칩의 경쟁 지위를 강화하고; 모델 특화 실리콘 가속기로 진출하며; AI 칩 공급망을 GPU를 넘어 다양화합니다.
업계 전문지Slicast · 2026년 8월 6일 23:20 UTC · 글로벌 · 출처: ServeTheHome
중요도 90

AMD는 모델 특화 AI 추론 칩을 개발하는 기업인 Taalas의 인수를 발표했으며, 이는 범용 가속기와 근본적으로 다른 접근 방식이다. 소프트웨어 구성을 통해 여러 모델을 실행할 수 있는 프로그래머블 하드웨어를 사용하는 대신, Taalas은 개별 모델 전용 실리콘을 제작한다. 각 칩이 단일 모델의 아키텍처와 연산 요구사항에 맞춰 특별히 설계되었기 때문에, 다른 모델을 배포하려면 물리적 칩을 교체해야 한다.

Taalas의 핵심 혁신은 일반적인 메모리 집약적 접근 방식을 대체하는 대안을 제시한다. 고대역폭 메모리에서 모델 가중치를 로드하고 프로그래머블 컴퓨팅을 사용하여 모델별 작업을 처리하는 대신, Taalas은 모델 가중치를 CMOS에 직접 내장한다. 이러한 모델 파라미터의 물리적 임베딩은 메모리 접근 오버헤드를 제거하여, 더 유연한 솔루션 대비 상당한 성능 향상을 가져온다.

현재 회사의 기술 시연기인 HC1은 Llama 3.1 8B를 실행하며, Taalas의 자체 측정에 따르면 사용자당 초당 최대 17,000개의 토큰을 처리한다. HC1은 TSMC의 6nm 공정을 기반으로 하며, 815제곱밀리미터의 다이 크기를 가지고 있고 530억 개의 트랜지스터를 포함한다. Taalas은 이를 NVIDIA의 H200 및 B200 가속기와 Groq, SambaNova, Cerebras 등 경쟁사 제품과 벤치마킹한다.

더 큰 현대식 모델은 전체 모델을 수용하기 위해 일반적으로 여러 레티클 크기 칩이 필요할 것이며, 특히 더 큰 아키텍처의 경우 더욱 그렇다. 이는 제조 및 운영상의 복잡성을 초래한다: 수십 가지의 서로 다른 칩 변형을 제조, 패키징, 테스트해야 하며, 단일 지연된 부품이 여러 배치의 생산을 중단시킬 수 있는 공급망 의존성을 관리해야 하고, 서로 다른 다수의 칩을 일관된 시스템으로 통합하기 위한 소프트웨어를 조정해야 한다. 그럼에도 이 접근 방식은 더 빠른 추론 속도와 잠재적인 비용 절감을 약속한다.

Taalas은 모델 가중치, 행렬 차원 및 기타 매개변수를 변경할 때 마스크 레이어 수정을 두 개로 제한함으로써 제조 제약을 해결한다. 모델당 여러 칩이 사용되더라도, 이 제약 조건은 완전히 새로운 GPU 아키텍처를 재설계하는 데 필요한 비싼 광마스크의 수를 크게 줄여준다.

이러한 모델 특화 접근 방식은 효율성을 위해 유연성을 희생한다. 전문화는 계산 부하를 간소화된 데이터 흐름으로 압축하여, 범용 설계에 내재된 메모리 및 컴퓨팅 오버헤드를 제거한다. 그 대가로, 하나의 모델에 맞춰 구축된 랙은 해당 모델이 변경될 때 쉽게 전환되지 않는다. 이는 이 접근 방식이 AMD가 시장의 가장 빠르게 성장하는 부문으로 식별한 안정적이고 대량으로 처리되는 추론 세그먼트에서 가장 실현 가능함을 의미한다.

"또한 모델이 급속히 채택되고 워크플로우가 이를 중심으로 구축되며, 따라서 GPT-3 20B 및 120B가 크기 카테고리에서 선도적인 수준보다 훨씬 뒤처졌음에도 불구하고 널리 채택되어 오늘날까지 여전히 사용되고 있는 것처럼 기본 부하가 일정 기간 지속되는 경우에도 도움이 됩니다. 모델 특화 칩을 사용할 수 있는 시간이 길어질수록 전용 하드웨어로 모델을 가속화하는 비즈니스 타당성이 높아집니다,"라고 AMD는 밝혔다.

AMD는 Taalas의 기술을 자사의 가속기 로드맵에 통합하고 Instinct 가속기를 중심으로 시스템 레벨 제품을 개발할 계획이다. 이번 인수는 Helios 랙 스케일 시스템, EPYC CPU, ROCm 소프트웨어를 아우르는 AMD의 풀스택 AI 플랫폼을 강화한다. 자체 모델 특화 추론 엔진을 갖춘 AMD는 안정적인 모델에 대한 최대 효율성을 위한 전용 옵션을 제공하여 기존 범용 Instinct 가속기를 보완한다. 남은 핵심 질문은 Taalas의 시연기가 얼마나 빨리 양산용 실리콘으로 전환될지와, 모델 특화 칩이 광범위한 시장에서 제공하는 유연한 가속기와 경쟁할 만큼 충분한 작업량을 확보할 수 있는지 여부이다.

원문 보기
AMD가 AI 모델 가중치를 실리콘에 직접 식각하여 추론 가속화를 구현하는 토론토… · Slicast