Zhipu 通过 Tmall 销售 Token,而其他 AI 公司尽管 Token 价格下跌却开始限制供应,引发了对底层算力约束的疑问。
近日,一位读者分享了智谱AI关于停止其长期订阅套餐的公告。此前的“无限周配额”GLM Coding Plan将停止自动续费,智谱AI将为老用户免费赠送两个月的新一档服务。就在几个月前,AI编程市场还在比拼谁的价格最低。而现在,竞争的指标已完全转变:你能实际消耗多少Token(词元)。
9月2日,智谱AI在天猫正式上线旗舰店,上架了其GLM Coding Plan。定价档位包括个人轻量版每月118元、专业版538元以及Max版1,078元,各档位对应不同的信用额度配额。该服务基于GLM-5.3构建,集成了包括ZCode、Claude Code和Codex在内的20多款主流智能体。曾经高度技术化的资源如今摆上了电商货架:AI使用配额可以像手机流量包一样直接购买。
然而, headlines的重点不仅仅是智谱AI在天猫上出售Token。这是一个反直觉的行业转折:Token变得更便宜了,但AI提供商却在日益收紧供应。
近几个月来,AI行业出现了一个明显的转变。Kimi因算力限制暂停了C端订阅。7月19日,月之暗面(Moonshot AI)宣布,其新推出的K3模型需求远超预期,触及现有集群容量上限。为了优先保障现有付费用户的算力,它停止了新用户订阅。同样,阿里云于3月20日暂停了新购Lite Coding Plan,随后在4月13日暂停了续费及升级。腾讯云在3月调整了混元模型的定价, notably将HY2.0 Instruct的输入成本从每千Token 0.0008元提高至0.004505元——涨幅超过460%。
为什么AI突然收回了之前的慷慨?二十年来,互联网产品证明数字化能将边际成本推向零。移动数据就是这一点的典型例子:一旦基础设施建成,传输额外一个GB的成本几乎为零。随着网络规模扩大,价格下降。许多人曾认为AI也会遵循同样的轨迹——更强的芯片、更高效的模型、每个Token的推理成本降低,从而带来更便宜的服务。
这一前提部分成立。智谱AI披露,通过持续优化模型架构和推理基础设施,其单位Token的推理成本今年年初以来下降了80%。该公司还确认,已利用数十万张国产芯片实现了大规模低成本推理。关键在于:虽然Token变便宜了,但消耗速度加速得更快。这是当今AI行业的核心张力所在。
Token并非普通的数据流量。每一个Token都代表着消耗的算力资源:GPU或AI加速器、高带宽内存、网络、存储,以及数据中心内相关的电力和冷却设施。Token是交易AI算力的计量单位。当模型仅仅进行聊天时,单次请求可能使用数百或数千个Token。但当被赋予复杂工作流任务时,消耗量会急剧增加。
智谱AI最新的半年报用硬数据捕捉到了这一转变。2026年上半年,智谱AI营收为9.54亿元,同比增长399.7%。其MaaS开放平台及API业务营收达到8.25亿元,同比激增2,735.7%,占总营收的86.5%。相比之下,去年同期的占比仅为15.2%,而本地部署营收则从84.8%降至13.5%。短短一年内,智谱的业务模式发生了根本性重构。
历史上,客户购买模型用于本地部署、定制和集成——通常产生一次性项目收入。如今,客户越来越多地直接调用云端托管模型,按次付费。这是经典的MaaS(模型即服务)范式。
此外,智谱的策略超越了“以低价换规模”。数据显示出精确的对齐:自年初以来,Token调用量增加了40多倍;API的平均售价上升了约101%;单位Token推理成本下降了80%;MaaS毛利率提升至24.6%。成本在下降,收入在扩张,使用量在激增,但平均售价仍在攀升。AI商业化似乎正在走出早期的价格战阶段。
起初,有限的模型能力迫使平台在低价或免费访问上竞争。但随着模型被证明能够执行复杂任务——代码生成、工具调用、多步执行——用户不再购买静态模型。他们购买的是自主完成工作的结果。
这一演变符合智谱AI的管理框架,该框架将业务轨迹划分为四个阶段:卖模型 → 卖调用 → 卖订阅 → 卖端到端任务结果。
智谱AI最终出售的不是Token。简单聊天机器人的时代——查询直接获得答案且仅需极少Token——正让位于智能体时代。当被指示“构建一个网站”时,智能体必须解析需求、研究、生成代码、调用工具、运行测试、调试、迭代和验证。单个任务可能消耗数十万至数百万个Token。更前方是多智能体编排,其中专用智能体负责规划、搜索、编码、测试和审查,进一步推高Token需求。
全球指标反映了这一爆炸式增长。2026年第一季度,全球每周Token使用量激增250%至22.7万亿。OpenAI平台的调用量从2025年10月的每分钟约60亿次跃升至2026年3月底的每分钟150亿次——不到六个月内增长了150%。摩根士丹利的一份报告指出,顶级大语言模型正在经历“非线性能力飞跃”,导致AI采用的爆炸性增长与系统性供应瓶颈发生碰撞。
现实并非Token变得昂贵,而是需求呈指数级扩展。这种动态类似于杰文斯悖论:随着资源效率提高和单位成本下降,消费量往往增加而非减少。AI正是经历了这一点。更便宜的Token使用户能够委托更多任务;更聪明的模型鼓励用户对日益复杂的工作流建立信任。Token消耗已成为一个自我强化的增长飞轮。
智谱AI的天猫店铺看似在出售AI配额,但其底层策略清晰可见:将模型能力转化为可连续计费的云服务。2025年,本地部署主导了收入;到2026年上半年,MaaS/API占比已达86.5%。公司明确将此进程表述为:“卖模型 → 卖调用 → 卖订阅 → 卖端到端任务结果。”
在财报电话会议上,智谱AI董事会秘书肖磊强调了这一结构性转变的重要性:“与营收增长率相比,营收构成的变化更值得关注。”