Tuesday, September 15, 2026
AI 인프라 · 뉴스 & 분석
컴퓨트·클라우드리포트
컴퓨트·클라우드 · 리포트

프랑스 스타트업 Kog는 기존 Nvidia 하드웨어에서 AI 추론 효율을 30배 향상시킬 수 있는 GPU 최적화 소프트웨어를 개발 중입니다.

소프트웨어 레이어 추론 최적화는 경쟁 대안으로 부상 중이며, Kog의 접근법은 매몰 GPU 자본으로부터 생산성을 해제하고 Nvidia의 수직 스택 지배를 위협한다.
업계 전문지Slicast · 2026년 8월 14일 14:50 UTC · 미국 · 출처: TechCrunch
중요도 68

AI 추론 속도 경쟁이 한창 진행 중인 가운데, 시장은 Cerebras와 그 목적 설계 칩들이 5월 IPO에서 보인 성과를 긍정적으로 평가했습니다. 그러나 프랑스 스타트업 Kog는 기존 GPU에서 훨씬 더 많은 성능을 끌어낼 수 있다고 확신하고 있습니다.

이 스타트업은 5월에 "기업이 이미 보유한 표준 데이터센터 GPU(AMD MI300X, Nvidia H200 등)에서 극도로 빠른 단일 요청 디코딩이 가능하다"는 것을 증명하기 위한 기술 데모로 주목을 받았습니다.

일부는 이것이 노트북으로 확장되지 않는다는 소식에 실망했지만, 다른 사람들은 잠재력을 보았습니다. 추론 속도와 비용이 이제 핵심 병목이 된 상황에서, Kog의 소프트웨어 최적화를 통해 기존 하드웨어의 새로운 기능을 활용하겠다는 약속이 상당한 관심을 받았습니다. CEO Gaël Delalleau는 TechCrunch와의 인터뷰에서 "우리는 200개의 실질적 비즈니스 기회를 확보했습니다"라고 말했습니다.

초기 피드백을 바탕으로 단독 창업자인 그는 소프트웨어 엔지니어링이 첫 번째 사용 사례가 될 것으로 예상합니다. Claude Code의 베테랑 사용자라면 때때로 결과를 기다리느라 수 시간을 소요한다는 것을 잘 알고 있습니다. Anthropic 자체도 속도의 가치를 인식하여 Claude의 Fast Mode에 대해 프리미엄 가격을 책정하고 있습니다.

Kog는 이러한 지연으로 인해 불만을 느끼는 고객들을 목표로 하고 있습니다. 일반적으로 전문적 작업을 위해 AI 워크플로에 의존하는 조직들입니다. 이 스타트업은 또한 프롬프트로 게임과 앱을 생성하는 설계 파트너들과 협력하고 있으며, 이들에게 Kog Inference Engine(KIE)을 통한 더 빠른 추론은 수익 증대를 의미한다고 Delalleau는 설명했습니다.

이 회사는 시장이 아직 완전히 성숙하지 않았다는 점을 인식하고 있습니다. 초기 고객과의 대화를 통해 Kog는 잠재 고객들이 작은 모델을 미세 조정할 준비가 되어 있지 않다는 것을 알게 되었습니다. "그래서 출시 이후 우리는 시장에서 보이는 수요를 충족하기 위해 더 큰 모델의 개발 가속화에 완전히 집중해왔습니다."

이는 Kog에 "30배 빠른 LLM 추론"이라는 약속을 실현해야 한다는 상당한 과제를 남깁니다. 그 데모는 초당 요청당 3,000개의 토큰을 달성하는 인상적인 성과를 거두었지만, 현재 오픈소스화된 약 20억 개의 파라미터를 가진 목적 설계된 소형 모델인 Laneformer 2B를 사용했습니다.

회의론자들의 의견과 달리, Delalleau는 동일한 접근 방식이 추론 칩을 어렵게 할 수 있는 크기의 더 큰 LLM에서도 동등하게 작동할 수 있다고 확신합니다. "GPU는 밝은 미래를 가지고 있습니다"라고 그는 말했습니다. Kog의 CEO에게는 GPU가 디코딩에 부적합하다는 개념이 오해일 뿐입니다. 최신 GPU는 점점 더 커지는 메모리 대역폭을 갖추고 있으며, 이를 활용하기만 하면 됩니다.

소프트웨어 최적화가 GPU의 사양을 초과하는 성능을 발휘하도록 도울 수 있다고 생각하는 것은 Kog뿐이 아닙니다. 역시 프랑스 출신인 ZML은 Nvidia의 CUDA를 우회하고 경쟁 칩 전반에 걸쳐 빠른 추론을 지원하는 하드웨어 독립적 소프트웨어를 출시했습니다. 하지만 Delalleau는 Kog가 Stanford University 연구소 Hazy Research와 더 유사하며, GPU 가속에 훨씬 더 깊은 초점을 두고 있다고 말했습니다.

Delalleau 자신은 연구원이 아니며, 그의 첫 번째 스타트업인 TechCrunch50 2009 동문 Stribe는 Kog와 직접적인 연결이 없습니다. 단지 그의 전 공동 창업자가 VC로 활동 중인 Kamel Zeroual을 통한 연결만 있습니다. Zeroual의 펀드 Varsity VC는 Kog의 시드 라운드를 공동으로 주도했습니다. 하지만 이 스타트업의 깊은 기술 초점은 그의 독특한 배경에서 비롯됩니다.

Delalleau는 École Polytechnique에서 고체 물리학을 공부했으며, 공격적 사이버보안(화이트햇 해킹) 분야에서 일했습니다. 그에 따르면, 이러한 경험이 그가 자신의 팀이 채택하기를 권장하는 사고방식을 형성했습니다. 과학적 측면에서, "물리 법칙과 GPU의 법칙을 이해하고 이를 최대한 활용하려는 사고방식이 있습니다."

해킹의 관점에서, DEFCON의 CTF 토너먼트 4회 최종 진출자는 "어떻게 작동하는지 이해하고, 그것이 반드시 설계되지 않은 목표를 달성하기 위해 이를 사용하려는 목적으로 어셈블리 언어와 바이너리 코드 수준까지 매우 낮은 수준에서 역엔지니어링"하는 방법을 배웠습니다.

이러한 접근 방식의 단점은 매우 손이 많이 가고 시간이 많이 걸린다는 것입니다. "모든 새로운 GPU에 대해, 우리는 수 주 또는 심지어 수 개월을 투자하여 세부 사항을 파고들고 그 하드웨어에 대한 GPU 엔지니어링 연구를 수행합니다." 11명의 팀 규모로, 이는 Kog가 단기간에 지원할 수 있는 칩의 수를 제한합니다.

장기적으로, Kog는 자신의 방법론을 에이전트 기반 파이프라인에 통합하여 더 많은 칩과 모델에 대한 지원을 가능하게 하기를 희망합니다. 유럽이 두 영역 모두에서 역량을 구축하려고 하는 가운데, 이는 이미 Scaleway로부터 지원을 받고 있으며 France의 Bpifrance와 French Tech 2030 프로그램으로부터 지원을 받고 있는 이 스타트업에 주권 이점을 제공할 수 있습니다.

현재로서는, Kog는 자신의 접근 방식이 LLM에서 작동한다는 것을 증명해야 합니다. 이것은 또한 추가 자금 조달의 핵심이 될 것입니다. "일단 우리가 10배 속도로 첫 번째 주요 모델을 구현했을 때, 이는 9월이 될 것이라고 생각합니다. 우리는 고객 견인을 시연할 수 있게 될 것이고, 거기서부터 Series A를 모금할 수 있을 것입니다"라고 Delalleau는 말했습니다.

원문 보기
프랑스 스타트업 Kog는 기존 Nvidia 하드웨어에서 AI 추론 효율을 30배… · Slicast