2026年9月25日星期五
AI 基础设施 · 新闻与分析
首页 › 资本市场 › 报道
资本市场 · 报道

Alibaba、字节跳动和DeepSeek 竞相构建100万亿参数级大型语言模型,升级中国人工智能资本支出竞赛

中国科技巨头对超大规模模型的承诺推动前所未有的数据中心GPU集群建设和电力需求,加剧全球对NVIDIA芯片和可再生能源的竞争
行业媒体Slicast · 2026年9月24日 UTC 10:16 · 中国 · 来源: 钛媒体
重要度 80

阿里巴巴在9月22日举办的云峰会上,将行业焦点重新聚集在大模型的"大参数"发展轨迹上。CEO吴永鸣透露,阿里巴巴正在准备训练新一代AI模型,参数规模介于50万亿到100万亿之间。在同一活动中,阿里巴巴通义千问项目负责人刘大义表示,扩展规律(Scaling Law)是通往人工超级智能(ASI)的关键路径,Qwen 4.5和Qwen 5计划向50万亿到100万亿参数规模扩展。

同日,业界传来另一则新闻:据《信息报》报道,DeepSeek正在训练一个拥有约2000亿参数的新模型。DeepSeek创始人梁文锋在最近一次投资者会议上也表示,公司计划将下一代模型推向80万亿参数。

两个月前的8月,英国《金融时报》援引消息源报道,字节跳动正在训练一个大模型,参数规模可能高达100万亿。

参数可以粗略理解为大模型的"脑容量"——模型进行推理时调用的已学习权重的总体积。100万亿是什么概念?比较一下2025年引起业界热议的DeepSeek-R1,它仅拥有6710亿参数——还不到100万亿的十五分之一。

从阿里巴巴到DeepSeek再到字节跳动,中国的大模型公司集体重燃了参数"越大越好"的信心。

但参数竞速的另一面是这样的:参数越大,所需的资源和成本越高,但智能水平并不按比例增长。模型一旦扩大,数据也必须随之扩大——不仅是数量,更重要的是质量。当所有人都在堆砌参数时,真正的分界线变成了计算效率:单位计算能力能买到多少智能。

阿里巴巴、DeepSeek和字节跳动都在赌100万亿参数。

在已发布的模型中,中国阵营的巅峰是Moonshot在7月发布的Kimi K3,总参数2.8万亿——世界上首个三万亿级开源模型。阿里巴巴的旗舰产品Qwen 3.8-Max约为2.4万亿,而DeepSeek目前的V4-Pro是1.6万亿。

看向海外,闭源模型的参数规模更高。业界估计Anthropic的Mythos 5约80万亿参数,Fable 5约50万亿。

换句话说,中国发布的最大参数模型仍然比海外估计的顶级产品落后一到两个数量级。而如果100万亿是目标,各公司目前的旗舰产品需要再扩大约五倍。

那么问题就来了:越大真的就越好吗?

支持"越大越好"的逻辑指向扩展规律——即当模型、数据和计算一起放大时,模型能力也会相应提升的原理。近年来,从数千亿到数万亿,每一次参数的飞跃都带来了明显的能力提升。理论上讲,参数越多确实意味着性能越好。

这正是刘大义称扩展规律为阿里巴巴通往ASI之路的关键的信心所在。

但扩展规律的威力并非无限。它需要前提条件:随着参数增加,数据体量和计算也必须按比例增长——而且至关重要的是,必须是"高质量数据"。

在万亿级规模,单纯堆砌参数会出现边际收益大幅递减的现象。所以从实际角度,一个号称拥有100万亿参数却无法获得等量高质量文本的模型,其能力提升不会按比例放大。

其他变量也很重要:数据、训练方法、架构和推理时算法。

例如,Kimi K3拥有2.8万亿总参数,但采用混合专家(MoE)架构,其中896个专家每次仅激活16个,实际激活的参数只有约1040亿。也就是说,名义上2.8万亿,但实际工作的远远更少。

在实际应用中,更多参数并不等于"更可用"。

一方面,更大的模型推理速度更慢,明显延长用户等待时间。另一方面,推理成本攀升,最终传导到价格——即便是只有数千亿或几万亿参数的旗舰产品,用户成本已经相当可观。

那么暂时搁置"是否可用"的问题,回到竞速本身:参数规模决定了能力天花板,天花板决定了排名。这就是为什么阿里巴巴、字节跳动和DeepSeek,尽管知道边际收益递减和成本飙升,仍然竞速向50万亿到100万亿跑去——他们竞争的不是今天的体验,而是下一代模型的入场券。

100万亿的账单:谁能承受大模型烧钱的代价?

超级模型能达到更高的智能水平,但更庞大的基础意味着需要更多的训练和部署资源。大模型烧钱已成为所有主要玩家的不言而喻的共识。

海外,微软、谷歌、Meta和亚马逊将2026年资本支出指引设定在约720亿到745亿美元。

中国市场同样激进:阿里巴巴2026年第二季度资本支出就达677亿元,同比增长75%,自由现金流则从正的738亿元跳变为负的466亿元。字节跳动2026年的资本支出上限可能高达70亿美元——约为前一年的三倍——并可能在2027年再投入1000亿美元。

钱去了哪里?最直接的是基础设施。

在训练GPT-4时,OpenAI需要的计算量以数千亿个token计,数万块GPU在高速互联的集群中协调工作数周或数月——而GPT-4只有20万亿参数。

预训练100万亿参数需要的GPU数量和时长按数量级增长:数万块高端GPU连续运行数月,电费、集群维护和芯片采购每一项都达到天文数字。

仅看数据中心投资:在云峰会上,吴永鸣宣布阿里巴巴云到2032年将运营全球数据中心超过20GW。高盛之前估计阿里巴巴目前在线容量约3到4GW。这意味着在六年内要新增16到17GW,扩容超过五倍。

根据英伟达黄仁勋在财报电话会上的披露,建设1GW计算容量的成本约50到60亿美元。按这个算法,阿里巴巴计划在六年内的16到17GW扩容可能需要总建设投资800亿到1万亿美元。

其次是推理成本。模型训练不是终点,而是起点。模型越大,每个推理回应所需的计算就越多。当在数百万日活用户上部署时,推理端的电力和计算开支往往会超过并压倒训练成本。

再有一笔常被忽视的隐形账单:数据。随着模型扩大,训练数据也必须扩大——不仅是数量,更是质量。业界共识很明确:高质量、经过精细清洗和标注的数据现在比原始计算能力更稀缺。

三笔账摆在台面上。参与者们能承受得起吗?

现金流已经敲响了警钟。在过去五个季度中,阿里巴巴的自由现金流有四个季度为负。最新季度资本支出677亿元。手中现金和流动性投资约4745亿元提供了缓冲,上月公司还通过香港上市配售融资约800亿港元用于AI基础设施。

但面对万亿级别的计算投资,这点弹药远远不够;持续的外部融资似乎在所难免。

字节跳动的故事也类似。据《信息报》报道,字节跳动2026年上半年净利润同比下滑个位数百分点至约200亿美元。它是中国AI资本支出最大的科技巨头,2025年AI相关投资150亿元,2026年进一步增加到200亿元。

面对缺口,字节跳动最近完成了约300亿美元的银团贷款——科技公司历史上最大规模——其中部分资金预期流入不断扩大的AI基础设施。

不可阻挡的军备竞赛:从Flash到100万亿参数。

在云峰会不到一个月前,阿里巴巴发布了Qwen 3.8-Flash-Next:总参数1250亿,每次推理仅激活60亿,训练成本相比上一代下降近90%,API定价低至DeepSeek-V4-Flash的三分之一。

同日,智谱的GLM-5.3-Flash在开源排行榜上发布:总参数3200亿,激活180亿。

在那两周内,业界的呼声是"成本革命":模型竞争中的决定因素不是谁最大,而是谁最节省、谁最快、谁能在高频使用中将单位成本压得最低。

一个月后,云峰会把"大"重新推向舞台中央,两种方法开始并存。

从模型角度讲,Flash级模型针对"高频、实时、成本敏感"场景优化,用户想要速度和经济性,所以激活参数保持最小。大参数模型则针对最难、最多样化的场景优化,需要最强的推理能力、最长的agent链、最广泛的能力覆盖。

让这两种方法能够并存甚至切换的是MoE架构——混合专家架构——它将模型分成许多"专家",每次推理仅激活其中一部分。它的核心贡献是完全解耦总参数和激活参数:总参数可以继续膨胀,维持能力天花板,而每次推理的计算成本保持可控,不随整体规模扩大。

对于大模型厂商来说,MoE重塑了成本结构本身:训练成本可以控制,推理只为激活的参数计费,实际上让一个基础模型能同时赌注小而快和大而强。

Flash和大参数最终回答的是同一个问题:如何从花费的每一美元中榨取更多智能。

但大参数仍然是一个承诺;100万亿目前还只是幻灯片上的数字。中国目前的旗舰峰值仍是2.8万亿。到这些模型真正发布时,牌桌可能早已被重新洗过。那时100万亿就不再是终点线,而成为新的起点线。

阅读原文
Alibaba、字节跳动和DeepSeek… · Slicast