Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
반도체·하드웨어리포트
반도체·하드웨어 · 리포트

AMD, AI 추론 칩 스타트업 Taalas 인수... 실리콘에 AI 모델 직접 내장으로 초당 최대 17,000 토큰 처리량 달성

Nvidia의 맞춤형 GPU와 경쟁하는 모델-인-실리콘 추론; 토큰당 비용을 주요 추론 벤치마크로 검증
업계 전문지Slicast · 2026년 8월 6일 20:05 UTC · 글로벌 · 출처: The Register
중요도 70

AMD는 토론토 기반 AI 칩 스타트업 Taalas을 인수하며, AI 하드웨어 분야에서 엔비디아의 지배력을 도전하기 위한 최신 행보를 보였다. 이 회사는 모델 가중치를 실리콘에 직접 새겨넣어 모델 전용 집적 회로를 생성함으로써 추론(inference)에 있어 획기적으로 다른 접근 방식을 개발했으며, 이는 성능을 한 차원 이상 향상시킬 것으로 기대된다.

목요일 장 마감 후 발표된 이번 거래는 12월 그록(Groq)과의 엔비디아 200억 달러 라이선스 협정과parallels를 이루며, 코드 어시스턴트 및 AI 에이전트와 같은 고성능 AI 서비스에 더 빠르고 저렴한 추론 서비스를 제공하겠다는 경쟁 구도를 형성했다. AMD는 재무 조건을 공개하지 않았으나, 이번 거래는 인수합병(acquihire)이 아닌 완전한 인수를 의미한다.

그록과 세레브라스(Cerebras)와 같은 경쟁사가 사용하는 기존 GPU나 데이터플로우 아키텍처와 달리, Taalas 칩은 HBM(고대역폭 메모리)에 모델 가중치를 저장하는 방식에 의존하지 않는다. 대신 가중치가 실리콘에 직접 새겨져 있어, 각 칩은 사실상 특정 모델을 위해 설계된 맞춤형 칩이다.

이 기술은 이미 검증되었다. 2월 Taalas은 TSMC의 6nm 공정으로 제작된 첫 번째 테스트 칩인 HC1을 공개했다. 메타(Meta)의 Llama 3.1 8B 모델을 처리할 때 이 칩은 초당 16,960개의 토큰을 처리했으며, 이는 발표 당시 엔비디아 GPU보다 48배, 세레브라스 가속기보다 8.5배 빠른 속도였다.

Llama 3.1은 2024년 중반 출시되어 현재는 다소 오래된 모델이지만, 레티클 크기(reticle-sized)의 칩은 주로 해당 접근 방식을 검증하기 위해 설계되었다. Taalas은 구현 세부 사항에 대해 비밀을 유지해 왔으나, 칩은 크게 두 가지 주요 구성 요소로 이루어져 있다: 가중치가 새겨지는 마스크-ROM 리콜 파브릭(mask-ROM recall fabric)과 KV 캐시 및 파인튜닝 어댑터를 저장하는 SRAM 리콜 파브릭(SRAM recall fabric).

이번 여름 출시 예정인 차세대 HC2 칩은 최대 200억 개의 파라미터를 지원할 예정이다. 개별 칩 기준으로는 작아 보일 수 있지만, 이 디자인은 파이프라인 병렬화를 통해 효율적으로 확장 가능하다. 50개의 가속기로도 트릴리언 파라미터 모델을 처리할 수 있으며, 이는 AMD가 보유한 랙 규모 컴퓨팅 플랫폼과 시스템 설계 전문 지식을 활용한다.

이러한 효율성 우위는 중요하다. 엔비디아의 최근 발표에 따르면 LPX 시스템은 동일한 모델을 처리하기 위해 수십 개의 GPU와 최소 2,000개의 그록 LPU가 필요하다. AMD는 인스틴트(Instinct) 기반 헬리오스(Helios) 랙과 Taalas 기반 가속기를 비집적(disaggregated) 아키텍처로 결합하여, GPU는 계산 집약적인 프롬프트 처리를 담당하고 토큰 생성은 Taalas 칩으로 오프로드하는 방식을 계획하고 있다.

고객들이 먼저 인스틴트 가속기에서 모델을 배포하고 검증한 후, 검증 완료 시 Taalas 가속기로 전환하는 틱-톡(tick-tock) 주기가 가능할 전망이다. AMD AI 부문 부사장 바미 보판나(Vamsi Boppana)는 "AMD는 고객이 모든 AI 워크로드에 적합한 컴퓨팅 솔루션을 유연하게 배포할 수 있는 풀스택 AI 플랫폼을 구축하고 있다"고 밝혔다.

그러나 이 기술에는 상당한 트레이드오프가 따른다. 일단 배포되면 칩은 특정 모델에 고정된다. LoRA 어댑터 수준의 수정을 넘어선 변경은 전체 재설계(re-spin)를 필요로 하며, 이는 비용이 많이 들고 시간이 소요된다. 새로운 프런티어 모델이 거의 매달 출시되는 상황에서, 고객들은 실리콘에 투자하기 전에 모델 선택에 대해 높은 확신을 가져야 한다.

다만, Taalas은 이러한 상황이 관리 가능하다고 밝힌다. 모델 변경 시 처음부터 시작할 필요가 없으며, 금속 층 두 개만 수정하면 되므로 비용과 회전 시간을 대폭 줄일 수 있다. 동사는 모델 가중치를 실리콘에 새기는 비용이 프런티어 모델을 처음부터 학습시키는 비용의 약 100분의 1이라고 밝혔다.

AMD는 이러한 장점을 수익화할 좋은 입지에 있다. 오픈AI, 앤트로픽, 메타 모두 주요 인스틴트 고객이며, 모델 개발자와 칩 설계자 간의 긴밀한 협력 관계는 GPT나 클로드가 결합된 Taalas 및 인스틴트 가속기 위에서 배포될 가능성이 있음을 시사한다.

이 기술은 모델 개발에도 영향을 미친다. 테스트 타임 스케일링(test-time scaling)은 응답하기 전에 모델이 더 오래 추론하도록 하여 환각(hallucination)을 줄일 수 있지만, 훨씬 더 많은 토큰을 필요로 하므로 비용과 지연 시간이 증가한다. 만약 Taalas이 토큰당 비용을 줄이고 출력 속도를 10~20배 높일 수 있다면, 개발자들은 코딩 어시스턴트, 챗봇, 에이전트에 즉각적인 혜택을 주는 방식으로 추론 시간을 더욱 연장할 수 있을 것이다.

규제 당국의 승인을 전제로, 이번 인수는 제4분기에 완료될 것으로 예상된다.

원문 보기
AMD, AI 추론 칩 스타트업 Taalas 인수... 실리콘에 AI 모델 직접… · Slicast