2026年2月6日,人类最后一次在OpenRouter的token用量统计中领先AI。仅仅半年后,这一差距被迅速拉大。数据显示,截至8月10日,智能体类的token消耗量从约0.51万亿激增至7.3万亿,增长了14倍;相比之下,人类用户的token用量虽然也涨到了1.4万亿,但增幅仅为2.8倍。巨大的落差让Peter感到恍惚,仿佛隔了十年,但这其实只是半年的时间。
首先,我们需要明确这组数据的来源与计算方式。OpenRouter作为全球最大的模型网关之一,连接着约70家供应商和开发者,每周处理约28万亿token。据联合创始人兼COO Chris Clark估算,这大约占全球推理总量的1%,其中一半来自美国。OpenRouter并不关注你是谁,只看你怎么用。具体方法是通过API Key追踪行为特征,包括工具调用的频率、两次响应的间隔时间、一轮对话的轮次等七项指标。通过加权评分,流量被划分为Agentic(智能体)、Mixed(混合)和Human(人类)三类。之所以能通过行为区分,是因为人类使用AI时会有自然的停顿、阅读和思考时间,而Agent则是持续不断地调用工具、循环执行任务。这种节奏上的差异,使得这套估算模型具有很高的准确性。
真正拉开人与Agent差距的,在于双方使用方式的本质不同。人类使用AI的模式通常是:打开对话框,输入一段提示词,等待回答,复制结果,关闭对话。全程交互次数不超过十次,token消耗通常在几千量级。而智能体的运作模式则完全不同:用户设定一个目标,AI便自动启动后续流程,包括读取文件、调用工具、生成结果、修正迭代,直到任务完成。人类在初始提示词中塞入大量上下文和规范,而AI则在此基础上不断增量读写。正如Peter所言,真正带来量级跃升的是“让智能体长时间自主运行”。同一个人,上午还在手动复制粘贴,下午挂上智能体,token账面消耗便会瞬间翻倍。
面对14倍的涨幅,人们的第一反应往往是“烧钱”。确实如此,但烧钱的逻辑并非表面那么简单。Peter指出,智能体天然具有多轮交互的特性,其近70%的token消耗来自提示词缓存,而缓存的计费价格远低于实时生成的token。这是因为Agent在执行任务时,需要反复读写同一份上下文(如代码规范、操作手册)。初次加载时需支付全价,后续轮次只需对增量内容付费,命中缓存的部分按极低比例收费。这意味着,虽然单价降低了,但用量的大幅飙升使得总成本依然惊人。Uber CTO曾透露,仅四个月就耗尽了全年的Claude Code预算,一场两小时的演示甚至花费了1200美元。EY的数据显示,客服交互成本从2023年的0.04美元飙升至2026年的1.20美元,增长了30倍。这并非模型变贵了,而是任务处理方式变了。高盛预测,智能体AI可能将2030年的token消耗推高24倍。此外,缓存Token虽然便宜,但需要占用内存。智能体长时间运行依赖内存承载完整的上下文,这也解释了为何近期高带宽内存如此紧俏。
那么,通过更换更便宜的模型来节省成本是否可行?真正的分水岭,其实不在于你选择了哪个模型。同一个模型,若仅作为搜索框使用,每日token消耗仅几千;若将其集成到实际业务流程中,接入自有文件和工具,每日消耗可达数千万。差距不在于模型本身,而在于是否将其真正融入工作流。OpenAI的数据印证了这一点:使用最深入的10%的公司,其每位活跃用户的token输出量是典型公司的8.3倍,这一差距在半年内从2.6倍扩大至三倍以上。头部公司在插件和技能的使用率上远高于普通公司,OpenAI内部甚至达到了95%。将常用任务封装为可复用的技能,能大幅减少重复搜索和返工,从而节省成本。
然而,精打细算的成本并不能保证任务的顺利完成。智能体流量的暴涨,并不等同于AI已经完全自主接管工作。许多任务仍由人发起,且在关键环节(如采购、签字)仍需人工审批。但问题在于,审批流程往往找不到人。有从业者提到,其智能体曾删除了广告账户中的18个视频,直到一天后才发现。这并非模型犯了错误,而是根本无人去检查那一步。Token消耗可以在半年内翻14倍,但验收的人力却无法同步增长。这或许是本轮增长中被忽略、却最为昂贵的账目。分析、调研、初稿等重复性执行动作将逐渐过剩,真正稀缺的是验证、判断以及决定什么值得做的能力。AI虽然已成为token的主要消费方,但它还不能替你签字。未来的核心问题不再是你用不用AI,而是当AI替你完成工作时,由谁来验收、谁来拍板下一步。
