China Telecom이 단일 RTX 3090 GPU에 배포 가능한 자체 AI 모델 제품군을 출시하여 현지 기업의 AI 추론을 지원한다.
차이나 텔레콤이 AI 사무 자동화 시장의 첫 수혜자가 될 수 있다.
지난 여름, 주요 기술 기업들이 AI 사무 도구에 집단적으로 투자를 두 배로 늘렸다. 이들은 에이전트 기능, 업무 진입점, 기업 워크플로우를 두고 경쟁하고 있으며, 코딩 이후 사무 작업이 에이전트의 다음 전쟁터가 되었다.
하지만 모두가 진입점을 놓고 싸우는 동안, 아직 그 문을 통해 발을 들이지 못한 기업들의 전체 범주가 존재한다.
이유는 실로 현실적이다. 이들 기업의 데이터는 기업 경계를 벗어날 수 없다. 모델은 온프레미스에 배포되어야 한다. 그리고 계산 자원은 제한적이다. 그럼에도 불구하고 긴 문서를 읽고, 복잡한 업무 프로세스를 처리하고, 업무를 완료해야 한다. 다른 기업들과 마찬가지로 말이다.
차이나 텔레콤의 새로 공개된 Xing4.0-29B-A4B는 정확히 이 공백을 겨냥한다.
그리고 더 많은 것을 가져온다. 완전히 국산화된, 가볍고 코드에 지능형인 에이전트 대규모 언어모델이다. 전체 기술 스택—국산 칩과 국산 학습 프레임워크부터 모델 학습과 추론 배포까지—이 체계적으로 적응되었다.
온프레미스 배포를 최대화하기 위해 Xing4.0-29B-A4B는 혼합 전문가(MoE) 아키텍처를 사용한다. 총 290억 개의 매개변수 중 추론 시에는 약 40억 개만 활성화된다. 4비트 양자화 이후 단일 RTX 3090 그래픽카드로도 실행할 수 있다.
하지만 실행하는 것은 첫 단계일 뿐이다. 기업들이 정말 신경 쓰는 것은 이렇다. 이 모델이 그 그래픽카드에서 실제로 무엇을 할 수 있는가?
예를 들어, 중요한 문서를 처리할 때 이 모델은 내용 이해, 지표 추출, 정보 조직을 완전히 로컬에서 완료할 수 있다. 데이터가 기업 환경을 벗어나지 않는다.
또는 200페이지 규모의 구매 입찰 문서를 생각해보자. 이 모델은 초기 기술, 상업, 가격 검토를 로컬에서 약 20분 내에 완료할 수 있으며, 행 단위 채점 근거를 제공한다.
더 나아가 로컬 배포 고려사항은 소비자급 그래픽카드를 넘어선다.
Xing4.0-29B-A4B는 화웨이 어센드 910C 계산 장비를 사용하여 완전히 학습되었으며, 국산 마인드스포어/마인드포머 학습 프레임워크와 개발 키트를 사용한다. 정말로 "국산 칩이 국산 모델을 학습시킨다"는 목표를 실현했다.
추론 배포 측면에서 어센드 적응과 검증을 완료했다. 학습부터 생산까지 국산 계산 경로가 실행 가능하다.
이 모델은 현재 깃허브, 허깅페이스, 기티, 모델스코프, 모델스허브에 공개되어 있으며, 동시에 API 지원도 제공한다.
특히 발행 시점 기준, Xing4.0-29B-A4B는 허깅페이스 인기 모델 목록에서 4위에 올랐다.
관심 있는 사람들은 즉시 사용을 시작할 수 있다.
성능과 기능 모두 제공하기
솔직히 하나의 그래픽카드에 모델을 맞추고 매일 기업 업무를 안정적으로 처리하는 것은 훨씬 많은 기초 작업이 필요하다.
기업 업무는 단순한 질문 답변 교환처럼 간단한 경우가 드물다.
문서를 읽고 정보를 추출하고 도구를 호출하고 결과를 검증하고 모든 것을 전달 가능한 자료로 조직해야 한다.
그리고 이 작업은 매일 일어난다. 안정성과 비용 효율성이 중요하다.
이러한 요구사항을 충족하려면 배포 및 운영 비용을 계속 줄이면서 진정한 기능을 구축해야 한다. 후자가 바로 Xing4.0-29B-A4B가 코딩과 에이전트 능력 강화에 집중한 이유다.
먼저 코딩부터 시작하자.
역사적으로 수천억 개 매개변수를 가진 모델은 작은 코드 스니펫이나 몇 줄을 추가하는 데 뛰어나다.
하지만 전체 저장소를 건네고 실제 엔지니어링 문제를 해결하도록 요청하면 상황은 더 어려워진다. 프로젝트 구조를 이해하고, 파일 간 인터페이스 호출을 추적하고, 문서, 로그, 과거 기록을 사용하여 문제를 찾아야 한다. 문제를 해결한 후에는 변경사항이 작동하고 다른 것을 깨뜨리지 않는지 확인해야 한다.
코드는 단지 최종 결과일 뿐이다. 그 앞에는 긴 업무 체인이 있다.
이 오랫동안의 문제에 대응하기 위해 Xing4.0-29B-A4B는 코딩 능력을 "스니펫 작성"에서 "엔지니어링 수행"으로 발전시켰다.
기본적으로 256K 컨텍스트를 지원하며 512K까지 확장 가능하므로 긴 코드, 문서, 로그, 과거를 포함한 단일 작업이 맞춰지도록 하여 전체 프로젝트를 이해할 수 있는 공간을 제공한다.
예를 들어, 산재된 계약 원장을 엑셀에서 거버넌스 대시보드로 변환하려면 단순한 차팅 함수 이상이 필요하다.
이 모델은 테이블의 업무 데이터를 이해하고 계약 요약, 예산 분배, 위험 식별, 컴플라이언스 경고를 한 페이지에 정리해야 한다.
여기에는 데이터 이해, 코드 생성, 기능 조직이 포함되며, 여러 각도에서 정보를 종합하여 개발을 완료한다.
Xing4.0-29B-A4B는 이러한 계약 원장을 완전히 온프레미스에서 시각적 거버넌스 대시보드로 변환할 수 있으며, 데이터는 기업 환경을 벗어나지 않는다.
에이전트 기능은 또 다른 수준이 필요하다.
요구사항을 이해한 후 이 모델은 작업을 분해하고 실행 순서를 정하고 도구를 호출하고 중간 결과에 따라 다음 단계를 결정해야 한다.
전체 체인을 통해 검증 가능한 결과를 제공할 때까지 작업하기 위해 Xing4.0-29B-A4B는 이러한 확장된 작업에 대해 목표 강화를 받았다.
예를 들어, 사용자가 요구사항을 명확하게 한 번 진술한 후 이 모델은 먼저 수행할 단계, 병렬로 실행할 수 있는 단계를 판단한 다음 날씨, 달력, 미리 알림, 여행을 위해 다양한 도구나 에이전트를 호출하고 작업을 앞으로 나아가게 한다.
하지만 이 모델이 업무를 처리할 수 있다면 기업들은 그냥 연결하면 될까?
한 가지 더: 기존 워크플로우와의 통합.
이미 사용 중인 개발 도구, 에이전트 프레임워크, 배포 플랫폼이 원활하게 연결되어야 한다. 그렇지 않으면 단순히 환경을 전환하는 것이 엄청난 추가 작업을 야기할 수 있다.
이에 대응하기 위해 Xing4.0-29B-A4B는 주류 에이전트 프레임워크와 도구인 OpenCode, Claude Code, OpenClaw, Hermes에 대한 목표 적응을 완료했으며, 여전히 LLaMA-Factory, MindFormers, SGLang, vLLM, KTransformers 같은 일반적인 도구 체인과 호환되어 기존 개발 환경과의 통합 장벽을 낮춘다.
물론, 앞서 언급한 기업들의 경우 실제 제약은 변하지 않는다.
데이터는 경계를 벗어날 수 없고, 계산 자원은 정말 제한적이다.
따라서 기능 업그레이드를 넘어 Xing4.0-29B-A4B는 배포 장벽을 계속 낮추고 있다.
기존 FP16 정밀도에서 29B 모델은 그래픽카드당 대략 60GB VRAM을 소비하며, 일반적으로 다중 그래픽카드 설정이나 비싼 A-시리즈 카드가 필요하다.
4비트 양자화 후 이는 약 15GB로 축소된다. 75% 감소다. 소비자급 RTX 3090과 4090이 이를 처리할 수 있도록 한다.
이 가벼운 비공개 배포 솔루션은 이미 실제 생산 환경에 진입했다.
지능형 고객 서비스에서 Xing4.0-29B-A4B는 사용자 통화, 신원 정보, 업무 기록이 전혀 구내를 벗어나지 않는 비공개 배포를 완료했다.
복잡한 요청에 직면하면 이 모델은 의도 파악, 작업 분해, 도구 호출, 결과 종합, 컴플라이언스 검증을 전체적으로 완료해야 한다.
이 솔루션은 복잡한 업무 처리에서 90% 이상의 성공률을 달성하는 것으로 보고된다.
여기서 그 기업들은 마침내 답변을 얻는다.
소비자급 카드로도 실행할 수 있다. 복잡한 작업을 완료할 수 있다. 도구와 업무 시스템이 원활하게 연결된다.
그럼 어떻게 작동할까?
아키텍처, 데이터, 학습, 배포에 걸친 포괄적 최적화
앞서 언급한 MoE는 답의 일부다.
이 모델은 290억 개의 총 매개변수를 가지고 있지만 추론 시에는 40억 개만 활성화한다. 이는 각 작업이 모든 매개변수를 동원하지 않는다는 의미이고, 계산 오버헤드가 그에 따라 감소한다.
하지만 긴 문서를 읽고, 엔지니어링 코드를 작성하고, 다단계 작업을 지속하려면 MoE만으로는 부족하다.
아키텍처, 데이터, 학습, 엔지니어링 최적화가 함께 작동한다.
먼저 아키텍처를 고려해보자.
더 긴 컨텍스트는 더 많은 내용이 맞춰진다. 하지만 내용은 공간을 차지한다.
긴 문서를 처리할 때 모델은 이전 내용의 계산 결과를 캐시한 다음 생성 중에 재사용한다. 친숙한 KV 캐시다.
컨텍스트가 길어지면서 캐시가 쌓여 VRAM을 소비하고 잠재적으로 추론을 느리게 할 수 있다.
진정으로 사용 가능한 긴 컨텍스트를 위해서는 캐시가 축소되어야 한다.
Xing4.0-29B-A4B는 다중 헤드 잠복 주의(MLA)를 사용하는데, 이는 캐시된 정보를 더 컴팩트한 형태로 압축하여 긴 컨텍스트 추론에 대한 VRAM 오버헤드를 줄인다.
더 나아가 읽기 오버헤드가 감소하면서 생성 속도는 보조를 맞춰야 한다. 여기서 Xing4.0-29B-A4B는 다중 토큰 예측(MTP)을 사용한다.
다음 토큰 예측에 집중한 표준 학습과 달리 MTP는 모델을 여러 후속 토큰을 예측하도록 학습시키며, 이 과정에서 더 긴 의존성을 학습한다.
이러한 예측은 추론에 도움이 된다. 미리 후보 내용을 생성한 다음 주요 모델이 이를 검증하게 하여 생성을 가속화한다.
또한 이 모델은 딥시크의 다양체 쌍곡 연결(mHC) 제약을 포함하는데, 계층 간 정보 흐름을 규제하여 반복된 신호 증폭으로 인한 학습 불안정성을 줄인다.
아키텍처가 준비되었으니 학습 데이터가 다음 순서다.
차이나 텔레콤은 수십조 개의 토큰을 포함하는 데이터 시스템을 구축했다.
사전 학습 데이터는 PB 규모 다중 출처 정제를 거쳤으며, 일반적인 내용뿐만 아니라 복잡한 테이블, 구조화된 지식 그래프, 에이전트 행동 궤적도 포함한다.
궤적은 에이전트 기능과 직접 연결된다. 이는 작업이 시작부터 끝까지 어떻게 흐르는지를 정확히 포착한다.
목표는 무엇인가? 어느 도구가 호출되었는가? 그것들이 무엇을 반환했는가? 결과를 고려할 때 다음 행동은 무엇인가?
체인으로 연결되면 이 모델은 한 단계의 결과를 다음 작업에 어떻게 입력하는지를 학습한다.
사후 학습에서 팀은 코드 실행, 온라인 검색, 도구 호출을 지원하는 고동시성 샌드박스를 구축했으며, 그 내에서 확장된 에이전트 작업을 구성했다.
코드가 실행되는지, 도구가 올바르게 작동하는지, 최종 결과가 요구사항을 충족하는지 모두 테스트 사례와 자동화를 통해 검증된다.
학습 자료 보유는 이제 실행 결과를 증거로 한다.
학습 중에 Xing4.0-29B-A4B는 점증하는 작업 난이도로 전개된다.
사전 학습은 4K 시퀀스 길이에서 시작하여 일반적인 지식과 기본 추론을 구축한 다음 점진적으로 코드와 복잡한 추론 데이터 비율을 높인다.
중간 학습에서는 시퀀스 길이가 32K, 128K, 256K로 차례로 확장되며 저장소 수준의 코드, 복잡한 추론, 에이전트 데이터가 추가된다.
사후 학습에서 팀은 코딩, 에이전트, 추론의 세 방향에 걸쳐 다중 전문가 강화 학습을 추구한 다음 모폴드를 통해 방향별 능력을 융합했다.
특히 학습은 뮤온과 QK-클립을 사용했다. 전자는 매개변수 업데이트를 최적화하고, 후자는 주의 계산 크기를 제어하여 수치 폭발을 방지한다.
마지막으로 엔지니어링 최적화 단계에서 텔레콤은 국산 계산에서의 효율적인 학습을 가능하게 했다.
이것이 "완전히 국산화된"이 구체적인 기술 세부사항이 되는 곳이다.
Xing4.0-29B-A4B는 어센드 910C 클러스터를 기반으로 마인드스포어/마인드포머를 사용하여 mHC 기능 적응, 교차 프레임워크 정밀도 정렬, 사용자 정의 연산자 개발을 완료했으며, 모델 아키텍처, 국산 학습 프레임워크, 국산 칩을 정렬했다.
계산 스케줄링과 VRAM 압력의 경우 팀은 DVM 그래프 융합, 세밀한 재계산, 어센드 C 맞춤형 융합 연산자를 적용하여 스케줄링 및 데이터 이동 오버헤드를 줄이고, VRAM을 절약하고, 효율성을 높였다.
팀에 따르면 모델 아키텍처, 컴파일, 연산자, 하드웨어 전반에 걸친 다층 조정 최적화 후 전체 학습 처리량이 기준선 대비 약 96% 개선되었다. 거의 두 배다.
사후 학습에 사용된 슬라임 강화 학습 프레임워크도 어센드 적응을 완료했다. 학습 프레임워크에서 연산자부터 강화 학습까지 팀은 모든 수준에서 목표 최적화를 적용했다.
즉, "국산 칩이 국산 모델을 학습시킨다"는 것은 칩, 프레임워크, 모델, 학습 프로세스가 연계하여 작동해야 한다는 의미다. 그리고 아키텍처에서 데이터, 학습, 배포에 이르기까지 이 포괄적인 노력은 마침내 책상 위에 쌓여 있는 기업 작업에 착지한다.
기업을 위해 AI 사무 작업을 현실로 만들기
마지막으로 기업들이 AI로 사무 작업을 진정으로 원활하게 사용할 수 있도록 텔레콤은 포괄적인 지원 패키지를 준비했다.
신속하게 배포하고 싶은 기업들은 Xing4.0-29B-A4B를 통합 계산-네트워크 어플라이언스에 사전 통합할 수 있으며, 환경 설정 및 설치 오버헤드를 줄이고 배포 주기를 단축한다.
로컬 계산이 부족할 때 기업들은 전용 지능형 계산 회선을 통해 클라우드 계산을 호출할 수 있으며, 데이터 거버넌스 요구사항 내에서 탄력적 스케일링을 달성한다.
국산 계산을 채택하는 기업들의 경우 지이위안 플래그OS 통합 오픈소스 AI 소프트웨어 스택을 기반으로 한 이 모델은 여러 국산 칩에 걸친 적응 경로를 해제했으며, 하드웨어 플랫폼 간 마이그레이션 및 배포 비용을 낮춘다.
다양한 규모, 다양한 기술 역량. 기업들은 맞는 배포 경로를 가진다. 소비자급 GPU에서 통합 계산 어플라이언스, 클라우드 탄력적 계산까지.
마지막 한 가지 질문: 왜 차이나 텔레콤이 구체적으로 이 가벼운 모델을 구축했을까?
290억개를 더 넓은 싱청 시리즈 내에 배치하면 답이 명확해진다.
이전에 차이나 텔레콤은 10억, 1000억, 조 단위 매개변수 모델을 배포했으며, 조 단위 매개변수와 음성, 의미론, 다중모달 방향을 함께 탐색했다.
Xing4.0-29B-A4B는 특정 공백을 채운다.
로컬 계산 제한, 그럼에도 복잡한 작업은 반드시 처리되어야 한다.
차이나 텔레콤은 이 필요성이 낯설지 않다. 솔직히 말해서 아마도 텔레콤만이 이 필요성을 보고 대응할 수 있을 것이다.
정부 서비스와 고객 지원에서 네트워크 운영까지, 텔레콤은 오랫동안 광범위한 비공개 배포 시나리오를 처리해 왔다. 데이터가 어디에 있을 수 있는지, 기존 장비가 얼마나 많은 계산을 처리할 수 있는지, 업무 워크플로우가 얼마나 복잡한지. 이들은 기업들이 모델을 배포하기 전에 해결해야 할 문제들이다.
이것이 가벼운 모델 설계의 기초가 되었다.
기업 현장 제약에서 시작하여, 계산 비용, 데이터 경계, 업무 요구사항을 결정하고, 모델 크기를 정하고, 필수 기능을 식별하고, 해당 배포 옵션을 제공한다.
이 모델에서 기업으로의 경로는 텔레콤의 "클라우드 변환, 디지털 진화, 지능형 번영" 전략 및 그 5대 기둥 지능형 클라우드 시스템과 일치한다. 계산, 플랫폼, 데이터, 모델, 애플리케이션.
모델은 이해와 작업 실행을 처리한다. 플랫폼은 통합과 조율을 관리한다. 계산과 네트워크는 운영을 가능하게 한다. 업계 애플리케이션이 이러한 능력을 특정 업무에 연결한다.
Xing4.0-29B-A4B는 이 포트폴리오가 가벼운 비공개 배포를 향해 나아가는 단계다.
국산 칩에서 학습한 다음 기업 장비와 실제 워크플로우에 적응한 것으로, "국산 칩이 국산 모델을 학습시킨다"는 가치는 다음으로 내려온다. 기업들이 이를 사용할 수 있는가? 기업들이 이를 좋아할 것인가?
그리고 이것이 싱청 시리즈 로드맵이 더 구체적인 이유다. 더 큰 모델이 얼마나 복잡한 작업을 처리할 수 있는가? 다양한 모달리티가 어떤 작업을 커버할 수 있는가? 이전에 장비와 배포 제약에 의해 제한되던 얼마나 많은 기업들이 이제 가벼운 모델을 사용할 수 있는가?
시작으로 돌아가서. AI 사무 경쟁은 계속된다.
데이터가 경계를 벗어날 수 없는 기업들, 계산이 제한적인 기업들. 그들은 계속 문서를 읽고, 자료를 제출하고, 업무를 수행한다.
이제 그들은 AI를 사용할 다른 방법이 있다.
다음 단계는 이미 책상 위에 있는 GPU에서 시작할 수도 있다.