对智能体AI代币经济学的分析突出了推理型工作负荷如何重塑计算需求,专业化推理优化芯片公司Groq、Cerebras和SambaNova成为关键受益者。
## AI代币是流动资金
"AI代币是流动资金,"谷歌云客户工程总监塔伦·潘特(Tarun Pant)在班加罗尔举行的2026年谷歌云初创企业峰会上主持一场关于初创企业AI经济学的讨论时表示。
这个观点反映了贯穿整个峰会的一个问题。讨论集中在更小的模型、缓存、模型路由、可观测性以及每项业务成果的成本——这些因素变得至关重要,因为AI产品正在超越演示阶段,开始大规模服务用户。
核心矛盾在于:一个代理可能需要检索公司数据、通过多个步骤进行推理、调用软件工具、调用另一个模型并重试某个操作才能最终产生结果。语音和视频会增加进一步的处理开销。代币可能变便宜了,但完整的工作流反而变得更昂贵了。
高德纳预计,到2028年,每个代理工作流的AI推理成本将增加5倍以上。其理由是:模型价格下降被消耗更多推理和代币的更复杂工作流抵消了。FinOps基金会看到成本问题快速蔓延。其2026年《FinOps现状》调查覆盖了1,192名受访者,代表年云支出超过830亿美元。98%的受访者表示现在管理AI支出,而2025年为63%,2024年为31%。对AI成本的可见性、将这些成本分配给业务部门以及衡量回报仍然是反复出现的问题。
**新的AI成本堆栈**
模型的价格仅是生产AI工作流成本的一部分。上下文——每个请求必须发送给模型多少数据——是第一个变量。模型本身是第二个:任务需要前沿的大语言模型还是更小的专业模型?接下来是工具:工作流调用多少次检索、API和推理步骤?复用——提示词、上下文或响应是否可以缓存而不是重新计算——是第四个因素。最后是结果:那笔总计算支出产生了什么业务结果?
**损益表已进入AI对话**
阿米特·库玛尔(Amit Kumar),谷歌云印度公司数字原住民业务总经理,在开幕致辞中定下了基调。"采用AI只为新奇的时代已经结束,"他说。
谷歌对初创企业的提案很直接:停止将AI能力本身视为成功,而是将部署与财务成果联系起来。库玛尔将这种价值分为成本优化、客户保留和收入生成。更广泛的建议是将自主AI嵌入业务流程,同时在扩展部署前建立可衡量的投资回报率路线。
时机很重要。AI初创企业在生成式AI繁荣的第一阶段花时间保证访问能力强大的模型和充足的计算资源。现在他们正在处理成功产品产生经常性推理账单时会发生什么。谷歌本身在8月承认了这个问题,推出了针对代理工作负载的额外成本控制,包括扩展的计费选项和旨在让公司更好地了解AI支出的工具。7月的更新为AI服务添加了早期异常检测,并为谷歌云预算添加了支出上限。
**AI代理扩展前的三个测试**
将代理从受控演示转移到生产环境会将测试从能力转变为可用性、控制和经济学。运营采用问的是:做这项工作的人是否会真正使用它而无需学习新的技术语言?企业治理问的是:数据访问、权限和操作是否可以保持受控和可审计?单位经济学问的是:每个成功的结果是否产生足够的价值来证明其推理和基础设施成本?
**每个代币的成本可能隐藏真实账单**
题为"解读初创企业AI经济学和真实投资回报率"的小组讨论将这个问题解码到工程选择。Accel的合伙人拉奇特·帕瑞克(Rachit Parekh)讨论了优化代币经济学。Kutumb的联合创始人兼技术主管莫希特·夏尔玛(Mohit Sharma)讨论了一个服务数百万用户的应用程序,这些用户发送大量用户生成的音频和视频。对于以这种规模运营的服务,将每个任务发送给最大的可用语言模型很快就变成了一个昂贵的默认选项。
讨论涵盖了微调较小的语言模型、大语言模型、缓存和为不同工作选择不同模型。不断回归的指标是每项业务成果的成本,而不是每个代币的成本。
CloudSEK的BeVigil公司联合创始人兼产品负责人赛义德·沙赫鲁克·艾哈迈德(Syed Shahrukh Ahmad)通过安全数据处理同一个问题。大量威胁信息必须通过AI计算管道,不同的任务不一定需要相同的模型。大语言模型可观测性成为成本控制的一部分,因为公司无法减少它看不到的东西:调用了哪个模型、输入了多少上下文、随后进行了多少次调用、响应是否被缓存以及任务是否成功。
这种转变在会议室外已经可见。谷歌在9月28日的帖子中告诉初创企业,规模扩展更可持续的团队正在放弃一刀切的模型策略,根据工作负载将前沿API与较小模型相结合。斯坦福大学的2026年AI指数指出了预期更多模型混合的另一个原因。截至2026年3月,Anthropic、xAI、谷歌和OpenAI在Arena排行榜上仅相差22个Elo评分点,该系统基于用户头对头偏好。斯坦福大学表示,这种汇聚正在将竞争压力转向成本、可靠性和领域性能。
**围绕模型之外的更多内容构建**
同样的方法出现在阿米特·库玛尔和Flipkart消费者购物应用科学副总裁萨米尔·沙阿(Samir Shah)的对话中。沙阿描述了基础模型中的快速变化,主张不要对任何单一模型投入太多工程投资。他的重点是模型周围的部分:工具、实体、提示词、知识和客户体验。他说,高效的实体和工具设计也会影响代币使用。设计不好的工具可能会通过模型推送更多不必要的上下文,并提高每次交互的成本。
对于Flipkart的对话式购物工作,这尤其相关。为婚礼购买衣服的人可能不会输入传统搜索所围绕的整洁产品关键词。用户可能会描述场合、混合英语和印地语、在对话中细化请求,然后才最后确定产品。沙阿表示,Flipkart的AI模式可以直接进入,而当系统认为对话会更好地满足用户意图时,某些搜索查询也可以转换为对话式体验。
他的语音示例特定于印度。当另一个人说话时,客户可能会说"嗯哈"或"好的",而不打算接管对话。围绕不同会话习惯训练的语音活动检测系统可能会将这些信号解释为中断。对于购物机器人,这个错误是立即可见的:每当客户简单地说"嗯哈"或"好的"时,它可能会中断自己。
**上下文也有计算成本**
谷歌云客户工程师帕鲁尔·萨胡(Parul Sahoo)在虚构的仓库自动化部署周围设置了三个条件:一线采用、企业治理和单位经济学。她的演示在虚构的Simple Logistics公司使用了三个角色来展示当代理离开沙盒并被允许与运营交互时会发生什么。
这个成本示例是很有启发的。早期实现被描述为推送数千个未压缩的PDF文档...
*(原文在此处截断)*