스타트업 프로세서는 CPU와 GPU를 통합 칩 아키텍처로 대체하는 것을 목표로 합니다.
약 한 달 전, 작은 기술 스타트업인 Tachyum은 Prodigy라는 새로운 프로세서 제품군을 발표했으며, 이를 세계 최초의 범용 프로세서 플랫폼이라고 주장합니다. 이 회사는 이 기술에 대해 기존 프로세서 대비 10배의 성능 개선을 제공한다는 등 여러 획기적인 주장을 제시했습니다. Tachyum의 최고경영자인 Dr. Radoslav 'Rado' Danilak에 따르면, Prodigy는 프로세서 설계에 대한 근본적으로 새로운 접근 방식을 나타냅니다. 이 아키텍처는 단일 프로그래밍 모델, 단일 명령 스트림, 완전히 일관된 메모리, 그리고 완전히 일관된 코어 간 통신을 특징으로 하며, 특정 AI 애플리케이션을 더 잘 다루기 위한 데이터 병렬성이 추가되었습니다.
Prodigy는 순차 실행 머신과 유사한 트랜지스터 수와 코어 크기 측면에서 프로세서 하드웨어 특성을 유지하면서 비순차적 성능을 발휘하는 통합 아키텍처로 설계되었습니다. Tachyum은 전통적으로 CPU 하드웨어에서 구현되는 작업을 컴파일러로 오프로드하여 이를 달성했으며, 그 결과 IPC, 클록 속도 및 전력 소비 감소가 향상되었습니다. 이 프로세서는 신경망에서 NVIDIA Volta 성능을 초과하며, Tachyum이 주장하는 바에 따르면 제어 집약적 특성으로 인해 Symbolic AI, Bio AI, General AI에서 기존 AI 중심 칩 대비 한 자릿수 더 나은 성능을 나타냅니다. Prodigy 아키텍처는 압축된 8비트 부동소수점 계수와 행렬 곱셈-덧셈 연산 등의 아키텍처 개선사항을 포함하여 AI 워크로드의 성능을 향상시킵니다.
Dr. Danilak의 Prodigy 성공은 Playstation 2 및 Tesla 프로세서 작업, 그리고 Sandforce에서의 플래시 메모리 컨트롤러 설계 및 Skyera에서의 플래시 기반 시스템 작업을 포함한 수십 년의 프로세서 설계 경험에서 비롯되었습니다. Prodigy에 대한 그의 설계 철학은 칩의 느린 배선 수를 줄이고 기존 배선의 평균 길이를 줄이는 것을 중심으로 합니다. 이는 프로세서 클록 속도가 트랜지스터 전환 속도에 비해 느린 배선으로 인해 지난 10년간 정체되어 있다는 현실과 배선이 트랜지스터에 비해 무한히 빠르다고 여겨지던 시절에 설계된 CPU 아키텍처에서 비롯된 접근 방식입니다. Danilak에 따르면, 획기적인 성능과 낮은 전력 소비는 이러한 백지 상태의 접근 방식에서 나타났습니다.
Danilak은 Tachyum이 Samsung, NVIDIA, Intel과 같은 경쟁사보다 작은 규모에도 불구하고 성공할 가능성을 어려운 경험에서 얻은 기술적 직관, 경쟁사의 실수로부터의 학습, 중요한 과제에 대한 집중된 규율에 돌립니다. 그는 자신이 설립한 SandForce에서 100명 미만의 직원으로 구성된 팀이 각각 수천 명의 엔지니어를 보유한 Intel, Samsung, Toshiba, Sandisk, Micron, Western Digital, LSI, Seagate 같은 회사들과 성공적으로 경쟁했다고 지적합니다. 그는 대규모 회사에서 진정한 혁신은 일반적으로 소규모의 혁신가 그룹에서 비롯된다고 강조하며, 10명의 엔지니어를 가진 소수의 그룹에서 핵심 혁신이 이루어진 NVIDIA의 사례와 컴파일러에서 실패했다고 제안하는 Intel의 실패한 Itanium 프로젝트의 사례를 지적합니다. 이는 Tachyum이 먼저 컴파일러를 개발하고 아키텍처를 그 주변에 구축하도록 한 교훈입니다.
Tachyum의 64코어 Prodigy 프로세서는 약 128TFLOPS의 피크 성능을 생성할 것입니다. 이 회사는 인간 뇌 프로젝트를 위한 후보 프로세서를 구축하려면 약 250,000개의 칩이 필요할 것이라고 제안했습니다.