2026年9月15日星期二
AI 基础设施 · 新闻与分析
首页算力与云报道
算力与云 · 报道

Together AI推出Provisioned Throughput,标准化按需推理定价和开源模型推理容量预留模式。

推理经济学从现货转向承诺容量;简化企业部署开源LLM的成本可预测性,相比专有API。
行业媒体Slicast · 2026年7月8日 UTC 16:01 · 美国 · 来源: The Futurum Group
重要度 61

Together AI推出了Provisioned Throughput,这是一个为前沿开源模型提供预留推理能力的产品层,结合代币定价、99%正常运行时间SLA和相比专有API最高节省90%的成本。该产品直接应对企业报告的两大最紧迫的生产AI问题:高计算成本和模型可用性。随着AI平台市场预计在2026年达到1813亿美元,Together AI正将自己定位为成本透明的开源模型推理服务替代品,对抗超大规模云提供商锁定的推理服务。

Provisioned Throughput是一款完全托管的推理产品,为企业提供前沿开源模型(包括MiniMax M3和GLM-5.2)的预留容量。该产品用基于代币的定价取代GPU小时计费,消除了大规模成本预测中复杂的基础设施成本计算。99%正常运行时间SLA为生产可靠性承诺提供保障,客户无需自己管理GPU基础设施。Together AI宣称该产品相比专有API替代方案的成本最多降低90%,对于在生产环境中运行开源模型的团队来说,这是对超大规模云提供商推理服务的直接挑战。

从GPU小时计费转向基于代币的定价在运营上意义重大。GPU小时模式迫使工程和财务团队将利用率模式转换为成本预测,在可变推理工作负载下这个流程往往失效。基于代币的定价使成本与实际消费直接关联,为大规模运行生产工作负载的团队提供了可行的预算建模方式。根据Futurum Group的研究,45.5%的组织将"高计算成本和基础设施需求"列为生成式AI采用的首要挑战,42%的生产团队将"模型可用性和正常运行时间"视为关键生产指标。Provisioned Throughput通过单一托管产品同时解决了这两个问题。此外,50.6%的组织按"成本降低和节省"来衡量AI计划成功,这表明推理定价结构不仅是运营细节,更是成功指标。Together AI声称相比专有API最高节省90%的成本,为采购团队提供了具体基准来评估现有超大规模云提供商的支出。

99%的正常运行时间SLA将可靠性从愿望转变为合同承诺。对于运行面向客户或收入关键型AI工作负载的企业,非托管推理容量存在真实商业风险。通过完全消除GPU基础设施管理,Together AI消除了可用性故障通常源于的操作表面积,将该责任从客户DevOps团队转移至提供商。

竞争定位值得关注。Futurum Group调查数据显示,63.9%的组织在"提供商托管的云平台"上部署生成式AI,如AWS Bedrock、Google Vertex AI和Azure AI Studio。Together AI并非要求企业放弃托管基础设施,而是提供运行开源模型而非专有模型的托管推理层。这将Provisioned Throughput定位为托管云类别中的补充或替代品。随着AI平台市场预计在2026年达到1813亿美元,并从现在到2030年以28.7% CAGR增长,成本透明的开源模型托管推理层的可寻址机会规模巨大。

阅读原文
Together AI推出Provisioned… · Slicast