ByteDance는 100조 위안(140억 달러 이상)을 시드 모델 개발에 베팅하고 있으며, OpenAI의 기초 모델과 경쟁하기 위해 증류 지름길을 거부하고 있습니다.
최근 The Information은 약 2주 전 열린 Seed 전사 회의에서 창업자 Zhang Yiming이 드물게 공개 성명을 발표했으며, 최첨단 대규모 언어 모델 추격을 위해 지식 증류 기법을 사용하는 것을 명시적으로 거부했다고 보도했다. 그의 입장은 명확했다. "ByteDance는 단기적 이익을 희생할 의지가 있어야 한다."
최신 Artificial Analysis 글로벌 LLM 랭킹에서 Moonshot의 Kimi K3 Max는 2위, Alibaba의 Qwen 3.8 Max는 4위, Zhipu의 GLM 5.2 Max와 DeepSeek V4 Flash는 각각 7위와 8위를 차지했다. 중국 모델이 이제 글로벌 상위 10개 위치의 거의 절반을 차지하고 있다. 반면 ByteDance의 Seed 2.1 Pro는 21위에 불과해 다른 중국 모델들보다 훨씬 뒤떨어져 있다.
ByteDance는 막강한 자원을 보유하고 있다. 자본 측면에서 회사는 연간 순이익 기준 인터넷 거대 기업에 속한다. 인재 측면에서 Seed 팀은 ByteDance의 추천 및 광고 시스템을 통해 성장한 최고 수준의 알고리즘 연구원들로 구성되어 있다. 컴퓨팅 용량 측면에서 전국에 걸쳐 배치되는 지능형 데이터센터의 수만 개 GPU 클러스터가 있다. 데이터 측면에서 Douyin과 TikTok은 세계 최대 규모의 네이티브 콘텐츠 풀을 차지하고 있다.
ByteDance 직원들에 따르면, 회사의 내부 평가는 ByteDance의 지식 증류 거부가 대규모 언어 모델이 다른 중국 AI 연구소보다 뒤떨어진 핵심 이유라는 것이다.
지식 증류는 간단히 말해 다른 대규모 모델이 생성한 답변을 사용하여 자신의 모델을 학습시키는 것이다. 업계에서 인정받는 "지름길"이다. 그러나 공개 보도에 따르면 ByteDance는 지식 증류를 추구할지 여부를 놓고 최소 3번의 내부 분쟁을 겪었다.
첫 번째 충돌은 2025년 1월에 발생했다. DeepSeek-R1이 등장하고 그 사고 방식이 전 세계를 휩쓸었을 때, Seed 내 연구원들은 지식 증류로 이를 모방할 것을 제안했다. Zhang Yiming은 이를 거부했다. 그는 Seed가 R1의 "의식의 흐름"을 단순히 모방하는 것이 아니라 인간처럼 "어떻게 생각하는지" 배우길 원했다.
두 번째 충돌은 NVIDIA의 Blackwell 칩 배포 이후 나타났다. 컴퓨팅 격차가 벌어지고 경쟁사들이 NVIDIA의 최신 제품에 접근하는 동안 ByteDance는 H20으로 버텨야 했으므로, 지식 증류 옹호자들은 다시 한번 주장을 펼쳤다. 그러나 Zhang Yiming은 다시 한번 거절했고 ByteDance는 Ulanqab과 Huailai의 추가 지능형 데이터센터 건설에 2,000억 위안을 투자하기로 약속했다.
그 다음은 Kimi K3의 글로벌 최상위급 모델 반열에 진입한 성공으로부터의 압박이었다. 국내 새로운 오픈소스 모델이 출시될 때마다 스트레스 테스트가 되었다. 내부 불안이 최고조에 달했지만 Zhang Yiming의 관점에서 랭킹은 표피적이고 상업적 주권은 현실이었다.
Zhang Yiming은 매번 입장을 지켰다. Seed와 가까운 소식통에 따르면, 오픈소스 모델에서의 지식 증류 금지는 API 탐지 같은 기술 수단을 통해 시행되며, GPT 생성 데이터를 학습 세트에 혼입하는 것에 대한 명시적 금지는 2023년 4월까지 거슬러 올라간다.
"ByteDance도 처음에는 지식 증류를 시도했지만 Zhang Yiming은 나중에 깊게 성찰한 후 우리는 긴 길을 가야 한다고 말했다. Alibaba, Tencent, ByteDance 규모의 회사들은 계속 다른 회사의 모델에서 증류하여 살 수 없다"고 한 국내 주요 기술 임원이 AI Technology Review에 말했다.
대규모 모델의 지식 증류는 "선생님의 답안지를 베끼는 것"에 비유할 수 있다. 이 길은 빠른 결과를 제공한다. 수백만 개의 고품질 지시 샘플을 입력하면, 모델의 벤치마크 점수는 수주 내에 극적으로 뛰어올라 빠르게 증류된 모델 수준에 근접할 수 있다. LLM 경쟁의 초기 단계에서 사실상 모든 참여자들이 이 접근 방식을 시도했다.
그러나 경쟁이 더 깊은 단계로 접어들면서 논쟁이 터져 나왔다. 2026년 이후 Anthropic은 Minimax, Moonshot, DeepSeek, Alibaba Tongyi Lab이 자신의 모델을 증류하고 있다고 반복적으로 공개적으로 비난했으며, 중국의 대규모 모델의 급속한 발전을 "지름길"에 직접 기인시켰다.
아이러니하게도 Anthropic 자신은 OpenAI 모델의 여러 지식 증류 사례와 해적 도서 데이터에 대한 학습으로 적발되었다.
Zhang Yiming의 "지름길을 거부"하려는 약속을 진정으로 지탱한 것은 더 깊은 기술적 판단이다. 데이터가 정점에 달하고, 컴퓨팅이 부족하며, 글로벌 모델 경쟁이 심화되는 단계에서 지식 증류는 당신을 다른 사람들보다 뒤처지게 할 수 있으며 다음 번의 지능 도약에서 완전히 뒤처질 수도 있다.
기술적 관점에서 ByteDance Seed의 지식 증류를 거쳐 증류 파벌에 합류하지 않고 처음부터 학습하는 것에 대한 약속은 상호 연결된 기술 진화 논리를 나타낸다. 처음부터 학습하는 것은 고통스럽지만, 천정을 돌파할 유일한 방법이다.
지식 증류의 근본적 성질은 다른 모델의 결과를 자신의 모델을 학습시키는 "정답"으로 사용하는 것이다. 효율적으로 보이지만 되돌릴 수 없는 치명적인 결함을 내재하고 있다. 바로 모델 붕괴이다.
2024년 7월 Oxford, Cambridge 등 기관의 공동 연구가 Nature 표지를 장식했으며, 모델이 AI 생성 데이터에 반복적으로 학습할 경우 원래 데이터 분포의 꼬리 정보가 점진적으로 사라지며 결국 되돌릴 수 없는 능력 저하를 야기한다는 것을 체계적으로 처음 증명했다.
근친 번식처럼, 첫 세대는 건강하고 정상으로 보이지만 유전적 다양성이 빠르게 침식된다. 몇 세대 후 열성 결함이 집중되어 갑자기 나타난다.
Meta의 ICLR 2025 연구는 심지어 학습 데이터에 0.1%의 합성 데이터만 혼입해도 모델 붕괴를 촉발하기에 충분하다는 것을 더욱 확인해 주었다. 더 낮은 비율도 독성 효과를 유지한다. 더욱이 모델 매개변수가 클수록 붕괴 효과가 특정 임계값에서 증폭된다. 단순히 매개변수를 쌓는 것으로는 문제를 해결할 수 없다.
현실 세계의 지식은 균등하게 분포되어 있지 않다. 일반적인 질문과 표준 답변은 정보 분포의 "머리" 부분에만 있으며, 드문 경계 사례, 직관에 모순되는 질문, 방언과 속어의 미묘한 언어적 뉘앙스, 틈새 분야 전문성은 모두 "긴 꼬리"에 숨어 있다. 이러한 긴 꼬리 요소들이 모델의 미지의 문제 처리 능력의 천장을 결정하며 지능의 진정한 경계를 나타낸다.
AI 생성 "표준 답변"은 본질적으로 이러한 꼬리들을 평탄화한다. 모델 출력은 가장 높은 확률 응답으로 향하는 경향이 있으며, 자동으로 틈새, 이상, 불확실한 콘텐츠를 필터링하여 가장 "정확한" 그리고 가장 평범한 결과만 남긴다. 반복적으로 이러한 데이터에 학습한 모델은 점점 더 확신을 갖고 점점 더 편협해진다. 벤치마크 점수는 여전히 올라갈 수 있지만 그들의 "세계관"은 조용히 붕괴된다.
ByteDance의 가장 큰 자신감은 정확히 데이터이다. Douyin은 매일 8천만 개 이상의 짧은 영상을 생성한다. Toutiao의 일일 추천 콘텐츠는 수억 개이며 해외 TikTok은 150개 이상의 국가와 지역을 서비스한다. 이것은 세계 최대 규모의 네이티브 인간 콘텐츠 풀이다. PB 규모 실제 영상, 텍스트, 댓글, 상호작용 데이터를 정제하고 노이즈를 제거하는 것은 수백만 개의 깨끗한 GPT 생성 지시를 단순히 취하는 것보다 훨씬 어렵지만, 오직 네이티브 실제 데이터만이 현실의 완전한 분포, 즉 낯선, 생생하고 예측 불가능한 꼬리를 보존한다.
Scaling Law의 본질은 더 많은 고품질 실제 데이터로 지능의 천장을 높이는 것이다. 합성 데이터는 기존 경계 내에서만 평탄화할 수 있으며 절대 이를 초월할 수 없다. ByteDance는 자신의 천장을 정의하는 길을 선택했다.
토큰화는 모델의 "눈"이다. 텍스트를 몇 개의 기본 단위로 분할할지 결정하며, 각 단위는 벡터 표현에 해당한다. 다른 누군가의 어휘를 사용하는 것은 그들의 언어 선호도와 인지적 입도를 수용하는 것이다.
예를 들어 Llama의 어휘는 영어 최적화된 것이다. 중국 관용구, 인터넷 속어 또는 danmaku 약자를 마주칠 때, 종종 4개 또는 5개의 산재된 글자로 분산된다. 이는 추론 효율성을 급격히 떨어뜨리고 비용을 팽창시킬 뿐만 아니라, 더욱 중요하게 의미론적 관계가 산산조각 난다. 모델은 입력 계층부터 시작하여 중국식 표현 논리를 진정으로 파악하지 못한다.
ByteDance Seed의 핵심 전장은 순수 텍스트 대규모 모델이 아니라 네이티브 멀티모달 능력이었다. Seed 2.0은 이미 네이티브 오디오-비주얼 동기식 영상 생성을 달성하며, 60초 2K 해상도 영상과 8개 언어 립싱크 정렬을 지원한다. 이 능력의 전제 조건은 모델이 기초 수준에서 텍스트, 영상 프레임, 오디오 신호의 원자 수준 매핑을 달성하는 것이다. 모든 의미론적 단위는 동일한 벡터 공간의 해당 시각 및 음향 단위와 정렬되어야 한다.
만약 다른 누군가의 모델을 증류한다면, 당신은 그들의 인코딩 기초를 상속받는다. 그들이 영상을 토큰화하는 방식으로 당신도 영상을 토큰화해야 하고, 그들이 오디오-텍스트 타이밍을 정렬하는 방식으로 당신도 동일하게 정렬해야 한다. 사후 미세 조정은 매개변수와 효과를 조정할 수 있지만 기초 토큰 공간과 의미론적 프레임워크를 변경할 수 없다.
증류하지 않는다는 것은 ByteDance가 처음부터 규칙을 정의한다는 뜻이다. 영상 프레임을 최적으로 토큰화하는 입도는 무엇인가, 오디오 리듬을 언어 모델로 인코딩하는 방법, 멀티모달 신호 전체에서 공동 주의를 수행하는 방법. 모든 기초적 결정이 사내에 남아 있다.
영상 생성 및 멀티모달 상호작용을 추구하는 ByteDance의 경우, 기초 아키텍처에 대한 통제가 단기 텍스트 리더보드 순위보다 훨씬 더 중요하다.
지식 증류를 통한 모델 학습은 본질적으로 경량 "마이크로 조정"이다. 다른 누군가의 이미 만들어진 기초 위에 서서 조정하는 것. 수백 개 GPU가 수주 동안 실행되면 결과를 보여준다. 빠른 효과, 낮은 비용. 많은 공급사들이 빠른 추격을 위해 선택한 길이다.
그러나 ByteDance의 전체 처음부터 학습 경로는 완전히 다른 규칙에 따라 작동한다. 200B 이상 매개변수 MoE 모델을 0부터 학습시키는 것은 단일 알고리즘 포인트를 비교하는 것이 아니라 전체 시스템의 어려운 엔지니어링 능력을 비교하는 것이다. 이것은 진정한 AI "중공업"이다.
초대규모 사전 학습에서 가장 중요한 지표는 MTBF(평균 고장 간격)이다. 완전한 사전 학습 사이클은 종종 수개월에 걸쳐 진행되며, 수만 개 GPU의 병렬 계산을 조정한다. 이 기간 중 단일 GPU 메모리 오류, 고속 링크 통신 중단, 연산 정밀도 오버플로우가 발생하면 전체 작업을 중단시킬 수 있으며 심지어 이전의 모든 계산 투자를 무가치하게 만들 수 있다.
클러스터가 클수록 고장 확률이 높다. 간단한 수학. 단일 GPU 평균 고장 간격이 100,000시간이라고 가정하면, 10,000개 카드의 클러스터는 평균 10시간마다 하드웨어 고장을 만난다. 밀리초 수준의 고장 탐지, 정확한 체크포인트-재시작, 완전한 고장 허용 복구 메커니즘 없이는 대규모 완전 학습이 불가능하다.
ByteDance의 경우 이 과제가 더욱 심화된다. 미국의 칩 수출 제한에 의해 제약을 받아 ByteDance는 NVIDIA의 최신 Blackwell 플래그십을 구입할 수 없으며, 성능이 제한된 H20만 사용할 수 있으며, 단일 카드 학습 효율이 해외 선도 플랫폼에 비해 훨씬 뒤처져 있다. 다른 회사들이 강력한 단일 카드 성능을 활용하여 학습 효율을 지원하는 동안, ByteDance는 더 큰 클러스터 규모, 높은 리소스 활용률, 극도의 엔지니어링 최적화를 통해 격차를 메워야 한다.
공개 정보에 따르면 ByteDance의 학습 클러스터는 Inner Mongolia의 Ulanqab, Shanxi의 Datong, Hebei의 Huailai와 Zhangbei, Anhui의 Wuhu 지능형 데이터센터에 걸쳐 있으며, 수만 개 카드에 걸친 분산 계산 네트워크를 구축하고 있다. ByteDance의 2026년 AI 인프라 자본 지출은 2,000억 위안 이상으로 증가했다. 회사의 순이익은 현저한 전년 대비 하락을 나타내고 있으며, 계산 구매와 데이터센터 건설이 Q3-Q4의 핵심 이유이다.
Zhang Yiming 자신은 Seed 팀에 관심을 절반 정도 할애한다. 이 수백억 위안 규모의 자금 조성과 창업자 수준의 주의 배분은 단일 모델의 성능이 아니라 초대규모 학습을 안정적으로 지원하는 전체 풀스택 엔지니어링 시스템, 즉 하향식 연산자 최적화, 클러스터 통신 스케줄링, 학습 고장 복구, 계산 리소스 관리를 자체 개발하는 것에 대한 베팅이다.
이 완전히 자체 개발된 이 학습 프레임워크 및 인프라는 조용히 초대규모 안정적인 학습을 지원하는 것이 가능하며, 이것은 ByteDance의 진정한 기술적 해자를 구성한다. 지식 증류 경로를 따르는 공급사들은 10,000개 카드 규모 안정적인 학습의 엔지니어링 문제를 절대 해결할 필요가 없으며, 당연히 이 중공업 급 시스템 능력을 축적하지 못한다.
Scaling Law가 계속 발전하고 모델 매개변수 규모가 계속 증가함에 따라, 경쟁의 임계값은 알고리즘에서 엔지니어링으로 이동한다. 그때쯤이면 완전한 인프라를 통제하는 플레이어들만이 테이블에 설 자격이 있다.
다른 모델의 결과에 대해 학습하면, 당신의 모델은 그들의 결과 분포를 학습한다. 말투, 답변 패턴, 심지어 RLHF 단계에 주입된 가치 선호도를 포함한다. 어느 질문에 대해 무엇을 말할 것인지 알지만 왜 그렇게 말하는지는 모른다. 결과를 모방할 수 있지만 이 뒤의 추론 연쇄는 아니다.
더욱 중요하게, 모델의 "영혼"은 다른 사람의 인장이 찍혀 있다. 좋은 답변이 무엇인가, 무엇을 거부할 것인가, 어느 맥락에서 어느 스타일인가, 이러한 기초적 선호도는 지식 증류 중 대량으로 상속된다. 그 후의 RLHF 또는 보상 모델 조정은 단순히 다른 사람의 기초 위의 장식일 뿐이며, 모델 동작 패턴을 근본적으로 변경하는 경우는 드물다.
Douyin의 추천은 완료율과 참여도를 측정하고, 전자상거래는 클릭-구매 전환을 측정하며, 짧은 영상 콘텐츠는 페이싱과 시각적 영향을 강조한다. 이러한 고유한 상업 논리는 보상 모델에 깊게 내장되어야 하며, 모델이 RLHF 중에 ByteDance 생태 제품 목표에 정렬되도록 해야 한다.
만약 GPT-4를 증류했다면, 모델의 "영혼"은 OpenAI의 선호도 논리를 전달한다. 당신이 사후 학습에서 어떻게 조정하든, 당신은 다른 누군가의 기초를 장식하고 있을 뿐이다. 오직 처음부터의 학습, 자신의 통제 아래에서 사전 학습부터 RLHF까지 전체 체인을 통한 완전한 학습만이 ByteDance가 자신의 극도의 상업 논리에 모델을 진정으로 정렬하도록 한다. 이것은 단순히 효과에 관한 것이 아니라 통제 가능성에 관한 것이다.
Financial Times 보도에 따르면, ByteDance는 100조 매개변수 대규모 모델 학습을 논의 중이며, Alibaba Qwen 3.8-Max의 24조 매개변수와 Moonshot K3의 28조 매개변수를 크게 초과하며, 국내에서 알려진 최대 매개변수 규모 모델 계획이다. 프로젝트는 여전히 초기 탐색 단계에 있으며, Seed Foundation 팀장 Xiang Liang이 주도하고 사전 학습 데이터 팀장 Shen Ke와 조정 중이며, 최종 공식 출시는 불확실하다.
이것은 전형적인 "ByteDance" 선택이다. 동등한 규모로 추격하기 위해 고민하는 대신, 직접 경쟁사 규모의 몇 배로 확대하여 규모의 도약을 통해 리더십 위치를 추구한다.
Scaling Law는 여전히 대규모 모델의 가장 신뢰할 수 있는 현재 발전 경로이다. 적절한 데이터 품질과 학습 효율이 주어진다면, 매개변수 규모 증가는 예측 가능한 능력 이득을 생산한다. 주류 플레이어들이 2-3조 매개변수 범위 내에서 경쟁하는 동안, ByteDance는 직접 100조를 목표로 한다. 기본적으로 규모와 시간을 맞바꾸며, 더 큰 투자를 사용하여 중간 추격 단계를 건너뛰고 다음 계층의 임계값에 직접 도달한다.
매개변수 규모를 두 배로 하면, 학습 어려움이 선형적으로 증가하지 않지만 지수적으로 증가한다. 데이터 공급, 계산 안정성, 정렬 어려움, 추론 비용 각각이 거대한 도전을 제기한다. 2,000억 위안 자본 지출, 70% 순이익 하락, 창업자의 절반 주의, 모든 칩이 이 "더 느리고 더 어려운" 길에 걸려 있다.
DeepSeek이 공식적인 OpenAI 지식 증류 비난에 직면할 때, 미국 입법이 모델 데이터 도용을 국가 안보 범위에 포함시킬 때, ByteDance의 선택은 갑자기 선제적 위험 회피 전략적 의미를 갖는다. 완전히 자체 개발된 완전 체인 모델은 지적 재산권 분쟁이 없으며, 규정 부담이 없으며, 글로벌 확장 및 장기적 기술 경쟁 모두를 위해 안전한 기반 위에 선다.
향후 3년 동안, 대규모 모델 기술의 패러다임 창은 빠르게 좁혀지고 있다. 현재 선도 플레이어들이 하는 기술 경로 선택은 향후 10년 이상의 경쟁 지형을 결정할 것이다.
지식 증류의 매력은 확실성에 있다. 목적지를 알고, 거기 도착하는 가장 빠른 방법을 알고, 투자 수익이 명확하게 보인다. 그러나 그 대가는 목적지를 정의할 권리를 영구적으로 잃는 것이다.
회의에서 Zhang Yiming은 모든 사람이 지능의 상한선을 자신의 목표로 추구해야 하며 Seed 모델 능력이 세계 최상위 수준에 도달할 것을 기대한다고 명확히 했다.