根据OpenRouter数据,AI代理现消耗比人类多5倍的令牌,自二月以来增长14倍。
Futurum Group首席执行官Daniel Newman最近强调了AI应用的一个重要里程碑:"目前AI被agents使用的频率是被人类使用的5倍。这一数字将加速到10倍,然后更高。"这一观察基于Andreessen Horowitz对OpenRouter数据的分析,数据显示截至2026年8月,agents消费了7.3万亿个token,而人类消费了1.4万亿个token。这已是agent使用量在该平台首次超过人类使用量约6个月之后。
然而,agents token主导的现象掩盖了一个重要细节。根据a16z对OpenRouter数据的分析,超过85%的agents token来自缓存提示。这意味着agents主要是在重新阅读已经处理过的信息,而不是处理全新的查询。
OpenRouter是一个领先的AI模型网关和路由平台。它使用基于工具调用率、回合计数和间隔时间等因素的加权计分系统,将每个API密钥分为agentic、mixed或human三个类别之一。自2026年2月以来,数据显示agents使用的token增长了14倍,而人类使用量增长了2.8倍。mixed类别(可能代表结合了agents和人类特征的行为)在同期增长了4.7倍。根据混合流量最终如何分解,agents的token优势可能会有所变化。值得注意的是,这些数据衡量的是token量而非支出,且来自单一平台,尽管趋势确实在4月和7月出现了下降。
增长模式超越了OpenRouter范围。McKinsey的2026年AI状态调查发现,来自大型组织的40%受访者报告正在扩展AI agents,相比一年前的27%有所增加。类似地,一家在租赁的Nvidia H200上测试DeepSeek的呼叫中心咨询公司发现,其agents在9月份在Claude Code上的使用中,"96%的所有输入都是重新阅读旧对话"。
对缓存提示的依赖带来了新的基础设施挑战。虽然缓存token的成本远低于处理新鲜提示,但它们仍然必须存储在内存中。a16z指出,随着模型在KV缓存中存储上下文,对高带宽内存(HBM)的需求上升——"KV缓存正在超过GPU HBM容量"。内存约束已经很紧张。Micron预计RAM和存储短缺将在2027年和2028年恶化,客户将支付更高的价格,同时内存制造商优先为AI数据中心分配HBM。如果Newman的预测成真,比率从5倍升至10倍、20倍及更高,PC购买者将越来越多地与agents争夺稀缺的内存资源。