阿里巴巴发布125B参数Qwen模型,加剧了全行业降低AI推理成本的竞争。
8月26日,阿里巴巴发布了Qwen3.8-Flash-Next,这是一款基于1250亿参数混合专家(MoE)架构的开源权重模型,每个令牌仅激活60亿参数。该公司表示,其训练成本约为前代产品Qwen3.7-Plus的九分之一。生产环境API Qwen3.8-Flash将在通义千问云上线,公布的价格为每百万输入令牌0.16美元,每百万输出令牌0.47美元。
这些定价使Qwen在市场中极具竞争力,相比之下,Claude Opus 5收费为5/25美元,GPT-5.6 Sol收费为5/30美元,Sonnet 5收费为2/10美元。Qwen与Sol之间的输入价格差距超过30倍,而输出价格差距则超过60倍。
在架构方面,Qwen3.8-Flash-Next将1250亿参数的主体模型与510亿参数的n-gram嵌入参数以及40亿参数的多令牌预测参数相结合。它从512个专家池中路由十个专家加上一个共享专家,并利用门控DeltaNet和Qwen稀疏注意力机制。n-gram层代表了显著的效率提升:这是一种参数缩放机制,用简单的内存查找替代矩阵乘法,以低廉的存储和带宽成本换取昂贵的算术运算。
发布的FP8检查点重量约为186GB。因此,“6B活跃”意味着以小模型每令牌的FLOPs实现了大模型的能力,而非拥有6B模型的内存占用。该架构并非专为移动设备设计。在四块H200 GPU上的服务器部署中,单流工作负载报告每秒约140个令牌;而在TP4 B200配置下,SGLang利用主机内存卸载n-gram表,实现了每秒540个令牌的解码速度。主要的约束已从加速器的峰值吞吐量转移到内存层次结构工程,包括HBM、主机DRAM、PCIe带宽、预取和缓存策略。
阿里巴巴的内部评估显示性能强劲:在SWE-bench Pro上得分为62.5,在GPQA Diamond上得分为91.7,在LiveCodeBench v6上得分为91.9。公司将这些结果定位为可与Claude Opus 4.6竞争,并指出Flash-Next在许多选定的基准测试中得分更高。
有两个重要的注意事项需要冷静看待。首先,阿里巴巴使用其选择的Claude Code工具包对其模型进行评估,并与Anthropic公布的Opus 4.6结果进行对比,而CoWorkBench仍是一个内部基准。更关键的是,Opus 4.6并非Anthropic当前的前沿模型;Opus 5、Opus 4.8和Sonnet 5均在积极交付中。针对这些最新版本的独立复现尚未发布。
在发布当天,阿里巴巴完成了800亿港元(约合102亿美元)的股权配售,所得款项的100%用于AI基础设施。其中约479亿港元用于全球计算资源,319亿港元用于超大规模数据中心、存储、数据库和网络。内部人士也增加了持股:据报道,马云购买了约7700万美元的阿里巴巴股票,而董事长蔡崇信和CEO吴泳铭合计增持了2600万美元。
这种资本结构从根本上塑造了0.16美元定价层的逻辑。阿里巴巴可以可持续地补贴模型推理,因为每次低成本的API调用都会推动企业客户转向其更广泛的云计算、存储和数据库生态系统。一家独立的模型公司无法复制这种交叉补贴。DeepSeek近期的定价轨迹说明了依赖收购级折扣的风险:其V4 Flash最初以0.14/0.28美元推出,但后来调整为非高峰/高峰时段输入0.22–0.44美元,输出0.66–1.32美元的费率。折扣定价本质上是暂时的。
为了说明经济账,处理10万输入令牌和2万输出令牌的一个典型代理任务,在Qwen3.8-Flash上成本约为0.025美元,在Sonnet 5上为0.40美元,在Opus 5上为1.00美元。按照这些比例,低成本模型在进行三十多次重试之前,其原始令牌支出就能赶上Opus。高端供应商仅凭微弱的基准优势无法维持40倍的价格差异。他们必须提供显著更高的首次尝试完成率、更少的所需重试次数、更快的延迟以及更少的人工升级,才能证明溢价的合理性。
OpenAI自身在7月30日为Luna降价80%后的数据证实,这一算术逻辑正在改变买家行为:Luna的使用量激增约14倍,估计收入仍增长了约34%。降价扩大了总支出而非侵蚀它,展示了教科书式的杰文斯悖论动态。
阿里巴巴加入近几周发货稀疏模型的其他两家供应商行列,这些模型具有50-60亿的活跃参数和1200亿以上的总容量:蚂蚁集团的Ling-3.0-flash(1240亿/51亿活跃)和DeepSeek V4 Flash(2840亿/130亿活跃)。这种重复确认了行业结构的转变,其商业后果遵循哑铃模式。商品化推理将压缩至接近原始基础设施成本,而前沿智能只要任务成功率差距足以证明溢价合理,就能保持其利润率。例如,尽管Anthropic定价较高,但它仍通过Vercel等网关捕获了大部分企业支出。
最容易受到这种压缩影响的公司是那些以前沿价格销售接近前沿能力的公司,以及整个价值主张仅依赖于API密钥、系统提示词和通用界面的包装业务。当同等能力可以以几分钱获得,或在Qwen社区许可下自行托管时——该许可允许私有部署、微调和研究,但要求对商业化模型即服务达成单独协议——这些企业面临过时的时间表是以季度计,而非年计。持久的竞争护城河现在 resides 于专有数据、评估基础设施、代理可靠性、工作流集成和分销渠道。这些资产无法简单地从Hugging Face下载。