AMD가 AI 추론 최적화 스타트업 Taalas를 인수해 추론 실리콘 및 소프트웨어 스택을 확충합니다.
AMD는 토론토 기반의 AI 프로세서 회사인 Taalas를 인수하기로 확정 계약을 체결했습니다. Taalas는 추론 특화의 가장 급진적인 접근 방식 중 하나를 대표합니다. 프로그래머블 가속기를 구축하고 모델을 로드하는 방식과 달리, Taalas는 모델 자체를 중심으로 하드웨어를 구축합니다. AMD는 8월 6일 이 계약을 발표했으며, 재무 조건은 공개되지 않았습니다. 거래는 관례적인 종료 조건과 규제 승인 대상입니다.
AMD는 Taalas 기술을 가속기 로드맵에 통합하고 이를 AMD Instinct GPUs와 결합한 시스템 수준의 솔루션을 개발할 계획입니다. 중요하게도, AMD는 Taalas를 Instinct의 대체품으로 제시하지 않고, Instinct 가속기, Epyc CPU, ROCm 소프트웨어, 네트워킹 및 Helios 랙 규모 아키텍처를 포함하는 점점 더 광범위한 AI 플랫폼 내의 또 다른 컴퓨팅 엔진으로 제시합니다.
"Taalas의 기술과 세계적 수준의 엔지니어링 팀은 차별화된 추론 성능과 효율성을 제공함으로써 우리의 AI 포트폴리오를 강화합니다"고 AMD 인공지능그룹의 수석 부사장 Vamsi Boppana가 말했습니다. Taalas CEO 겸 공동 창립자 Ljubisa Bajic은 AMD 합류가 회사에 "규모, 엔지니어링 자원, 글로벌 도달력"을 제공하여 작업을 가속화할 수 있다고 말했습니다.
Taalas는 2023년 Tenstorrent, AMD, Nvidia 출신을 포함한 AI 칩 경험이 풍부한 팀에 의해 설립되었습니다. 회사는 AMD 거래 이전에 약 2억 1,900만 달러를 조성했으며, 올해 초 발표된 1억 6,900만 달러 자금 조성을 포함합니다.
근본적으로 Taalas는 학습된 LLM을 직접 실리콘에 고정시키고 범용 프로세서를 범용으로 만드는 데 필요한 많은 기계 장치를 제거합니다. 유연성을 위한 효율성의 이러한 트레이드오프가 회사의 접근 방식을 정의합니다.
첫 번째 기술 시연자인 HC1은 Meta의 Llama 3.1-8B 모델을 실행합니다. 6nm 디바이스는 815mm² 면적에 530억 개의 트랜지스터를 포함하며 사용자당 약 17,000개의 토큰/초를 전달합니다. Taalas는 소프트웨어 프로그래머블 대안에 비해 성능, 비용 및 전력에서 대략 한 자릿수의 우위를 주장하지만, 이러한 비교는 회사에서 제공되며 그에 따라 취급되어야 합니다.
최신 가속기는 메모리와 계산 단위 간에 모델 파라미터를 반복적으로 이동합니다. Taalas는 대신 모델의 대부분을 디바이스에 직접 표현함으로써 스토리지와 계산을 병합하려고 합니다. 이는 HBM, 고급 패키징, 고속 메모리 인터페이스 및 상당한 데이터 이동을 제거할 수 있지만, 결과적인 실리콘이 훨씬 더 좁은 범위의 워크로드에만 유용하게 만드는 대가를 치룹니다. HBM에서 이러한 움직임은 오늘날의 고비용 메모리 환경에서 광범위한 추세의 일부로 보입니다. Semidynamics는 Gazzillion Misses 메모리 처리 기술을 사용하여 유사한 작업을 시도하고 있습니다.
Taalas는 새로운 모델을 맞춤형 실리콘으로 변환할 수 있다고 약 2개월이 걸린다고 주장합니다. 첫 번째 세대 구현은 공격적인 3비트 및 6비트 양자화를 사용하며, 회사는 이것이 GPU 구현에 비해 일부 품질 저하를 초래한다고 인정합니다. 두 번째 세대 플랫폼은 표준화된 4비트 부동소수점 형식으로 이동하며 훨씬 더 큰 모델을 지원할 수 있도록 의도되었습니다.
이 인수는 단순히 다른 GPU 설계 팀을 추가하는 것과는 상당히 다릅니다. AMD는 가속기 시장의 기본 가정에 도전하는 접근 방식을 구입하고 있습니다. 즉, 프로세서의 가치는 부분적으로 다음에 올 모든 모델을 실행할 수 있는 능력에 있다는 것입니다.
쉬운 해석은 AMD가 매우 빠른 추론 가속기를 구입했다는 것입니다. 이는 아마도 잘못되었을 것입니다. Taalas는 GPU가 탁월한 작업에서 아키텍처가 형편없기 때문에 정확히 흥미로운 것입니다. 즉, 마음을 바꾸는 것입니다. HC1은 모델을 실리콘에 커밋하여 HBM, 많은 가중치 이동 및 프로그래머빌리티에 필요한 상당한 제어 기계 장치를 제거합니다. 결과는 구축된 모델에 연결된 칩으로, Instinct나 Nvidia GPU와 직접 경쟁하는 범용 가속기로 판단될 때 불리하게 보입니다. AMD의 일부로는 훨씬 더 흥미롭게 보입니다.
자체적으로 Taalas는 올바른 모델을 선택하고, 실리콘을 구축하고, 충분한 고객을 찾아 정당성을 입증하고, 칩이 도착할 때 모델이 여전히 관련성이 있기를 바라야 합니다. AMD는 더 나은 위치에 있습니다. 유연성이 필요한 워크로드의 경우 Instinct를 유지할 수 있고, 모델이나 그 일부가 충분히 안정적이고 전문화의 보상을 받을 만큼 가치 있는 경우 Taalas 스타일의 실리콘을 사용할 수 있습니다.
흥미로운 가능성 중 하나는 중국 업계 논평가인 Yao Jinxin에 의해 제시되었으며, Taalas 스타일의 하드웨어를 혼합 전문가(mixture-of-experts) 모델의 고정 가중치 부분에 사용하는 것입니다. MoE 모델은 큰 전문가 가중치 컬렉션을 포함하며, 각 개별 토큰에 대해 일부만 활성화됩니다. 학습된 후, 그 가중치는 대부분 정적으로 유지됩니다. 프로그래머블 가속기는 주의, KV 캐시 관리, 오케스트레이션 및 동적 요소를 처리할 수 있는 반면, 모델별 엔진은 가중치가 고정되고 반복적으로 액세스되는 전문가 계산을 처리합니다. 이렇게 하면 Taalas는 Instinct의 경쟁자라기보다는 유용한 동반자가 됩니다.
정확한 분할은 다를 가능성이 있지만, 원칙은 타당합니다. AMD는 이미 CPU, GPU, 적응 형 컴퓨팅, 네트워킹 및 점점 더 완전한 AI 플랫폼을 포함한 이기종 시스템에 적응되어 있습니다. AI 워크로드의 모든 부분이 전통적으로 시스템이 구축된 방식이기 때문에 같은 프로세서 유형에서 실행되어야 한다는 본질적인 이유는 없습니다.
AMD는 또한 Taalas가 독립적으로 쉽게 만들 수 없는 것을 제공합니다. 즉, 매우 큰 고객에 대한 액세스입니다. 하이퍼스케일러는 하나의 모델만 실행하는 칩을 구입하는 것을 주저할 수 있지만, 대부분의 워크로드가 프로그래머블 하드웨어에 남아 있고 특히 중요하고 안정적인 부분이 최적화된 실리콘을 얻는 AMD 시스템을 편하게 구입할 수 있습니다. 그 시점에서 "이 칩은 하나의 모델만 실행합니다"는 결함처럼 들리기보다는 설계 선택처럼 들립니다.
더욱 설득력 있는 포인트는 Taalas가 완성된 제품보다는 프로세스로서 AMD에 더 가치 있을 수 있다는 것입니다. HC1은 개념을 증명하지만, 진정한 상은 학습된 모델을 가져와 약 2개월 내에 실리콘으로 바꾸는 능력일 수 있습니다. AMD가 이를 반복 가능하게 만들고 자신의 설계, 패키징, 소프트웨어, 제조 관계 및 고객 액세스와 결합할 수 있다면, 단일의 일반적이지 않은 가속기보다 더 유용한 것을 인수한 것입니다.
훈련 중에 일반성은 엄청나게 가치 있습니다. 모델은 너무 빠르게 변하고 실험이 너무 중요합니다. 매우 큰 추론 볼륨에서 계산이 변합니다. 동일한 가중치가 수십억 또는 조 단위로 읽혀지면, 유연성을 유지하는 데 필요한 하드웨어 오버헤드는 점점 더 비싸집니다.
에이전트 워크로드는 논증을 더욱 밀어냅니다. 인간 중심의 채팅은 여전히 사람이 답변을 소비할 수 있는 속도로 부분적으로 제약을 받습니다. 머신 투 머신 에이전트 워크로드는 그렇지 않으며, 작업 속도는 돈이 됩니다.
이는 Taalas, Groq 및 Cerebras와 같은 아키텍처에 GPU를 완전히 대체하지 않고도 추론 문제의 일부를 공격할 여지를 제공합니다. Taalas는 여전히 주장된 성능이 생산 워크로드로 변환되는지 증명해야 합니다. 첫 번째 디바이스는 공격적인 양자화를 사용하며, 실제 배포는 헤드라인 토큰/초 수치에 깔끔하게 맞지 않는 제약을 포함합니다. 아마도 AMD는 기술을 충분히 긴밀하게 검토하여 구입할 가치가 있다는 것을 자신에게 확신시켰을 것이며, 이는 Taalas에 작은 독립 회사로서 가졌던 것보다 훨씬 더 많은 신뢰를 제공합니다.
근본적인 경제 문제는 여전히 남아 있습니다. 모델이 실리콘으로 바뀌는 것이 가치 있을 만큼 얼마나 오랫동안 안정적인 상태로 있어야 합니까? Taalas는 모델에서 실리콘으로 약 2개월이 걸린다고 말합니다. AMD가 그 프로세스를 산업화할 수 있다면, 답은 "우리가 가정했던 것만큼 길지 않을 수도 있습니다"일 수 있습니다.