Token匮乏已成为当前AI创业者最为焦虑的核心问题。7月,在上海世博展览馆举办的2026世界人工智能大会上,除了忙碌的机器人和密集排列的超节点机柜,记者听到最多的话题便是“Token”。
一位来自杨浦区的个人创业者站在展馆门口,向《IT时报》记者算了一笔账:他开发AI短漫剧应用,每月在Seedance上的API调用费用就要上千元。“身边真正做开发的,很少有人用便宜的方案。”他表示,无论国内外模型,只要好用,创业者都愿意咬牙付费。
与此同时,展馆另一端,厂商们正热火朝天地讨论如何将Token做成“工厂”,实现大规模、标准化的生产,像印钞票一样输出Token。在Token告急的背景下,Token工厂正加速登场。
启明创投主管合伙人周志峰在WAIC“启明创投·创业与投资论坛”上感慨,AI产业的“速度、强度、烈度”达到了前所未有的高度。基于OpenRouter的数据,他展示了一组惊人的趋势:美国企业使用中国模型构建AI应用的Token占比,从2025年上半年的4.5%跃升至2026年年中的46%;自2026年2月8日以来,美国公司每周调用中国AI模型的比重持续保持在30%以上。“这意味着美国企业将近一半的Token都在中国模型上运行。”周志峰指出,Token贯穿了这条发展路径,是不可或缺的“燃料”。
什么是Token工厂?通俗来讲,这是将底层的算力、模型、推理引擎打包成标准化的Token服务,按量售卖、按需交付。它不再是单纯卖硬件或算力,而是直接出售“智能输出”,你付多少钱,就给你多少Token,用完即止。
“客户只要结果,那我直接打包给他就行了。”在张江科学会堂,来自天津的融科联创信息技术有限公司工作人员告诉记者,他们正在考虑向Token工厂方向转型,既要做服务器,也要卖Token,“现在的趋势就是这样”。他解释,很多中小客户不懂算力调配,也不关心底层架构,“客户可能连GPU和CPU都分不清,但清楚自己需要Token”。
于是,一种“简单粗暴”的解决方案应运而生:一台预装模型、推理引擎与计费系统的服务器,插电即可启用,按Token计费。“卖给中小企业,一台就够了,”他说,“顶多两三台”。
这种模式不仅限于服务器厂商,正在席卷整个算力产业链。清华大学背景的清程极智提出了Token“前店后厂”模式,后厂是标准化的算力集群,前店是Token商店;PPIO发布了面向Agent时代的“智能Token工厂”;范式智能则将展台打造成“AI 2.0 Token工厂”的全景展示,创始人戴文渊透露,2026年第一季度的Token收入已超过去年全年。这种模式的诱惑力在于,如果集群利用率做到极致,毛利率可能达到70%至80%。
周志峰预测,未来12到24个月,AI应用的商业模式将加速脱离互联网时代的Freemium(免费增值)逻辑,转向以结果和价值定价。同时,原本被称为“AI水电煤”的Token付费模式正在发生变化,一批AI产品开始将计费单位从“Token”换成“任务完成数”甚至“有效交付件”。衡量AI公司的核心指标,将从用户规模转向单位智能成本创造的商业价值。
这一趋势已在多个领域显现:Zendesk在2025年初推出了基于AI解决方案的定价模式,按“成功解决的工单数”收费,而非按客服座席数;Intercom将AI客服Fin的定价锚定在“自动解决率”上;Salesforce的Agentforce平台直接以“每次AI对话”为计费单元;法律科技公司Harvey则按“成功完成的法律研究任务”定价。
尽管当下AI行业人人言必称Token工厂,但至今仍未形成统一的行业标准。这里的“标准”指的是Token从生产到交付全链条的质量、计费、计量、服务等级等一整套规则体系。中国工程院院士郑纬民指出,Token的实际商业价值由首字延迟、生成速度、并发承载能力、服务稳定性四大指标共同决定。不同业务场景需要不同等级的服务标准,只有高等级、高品质的Token才能支撑复杂智能体的规模化落地。
“行业普遍存在模型虚标、算力质量不透明、计费模式粗放等问题。”郑纬民表示,不同业务对服务标准要求不同。山海引擎COO彭璐坦言:“行业普遍存在模型虚标、算力质量不透明、计费模式粗放等问题,压缩模型沿用原品名报价、节点缓存命中率差异,导致同等算力调用成本悬殊。”每家公司的套餐价格都不一样,目前没办法统一定价。
在张江科学会堂展区,博思芯宇展台打出了一张“Token成本拆解”牌:单位Token成本 = Token总成本除以有效Token产出。Token总成本由三部分构成——CAPEX(资本性支出,算力设备折旧)、OPEX(企业的日常运营开支,包括电费、散热、运维等)以及有效产出保障成本(故障防控、容错调度),试图帮算力运营商算清楚每一分钱。启明创投也将安全可信与产品效果、Token成本并列为影响企业AI大规模落地的三大关键变量。
Token工厂,是被现实逼出来的生意。在H2算力展区,一位做医疗影像AI的创业者向记者咨询Token工厂产品。他每天处理大量CT图片,上个月光API调用费就烧掉了上万元,“想来大会看看有没有更便宜的Token”。他的话道出了行业的现状。
Token的消耗量已经膨胀到了令人咋舌的地步。周志峰透露,中国日均消耗大模型Token,从2024年1月到现在上涨了超千倍。数据显示,截至2026年3月,中国日均Token调用量已从2024年初的约1000亿增长至140万亿。阶跃星辰联合创始人、首席技术官朱亦博指出,在Token需求快速增长的同时,算力供给增幅相对有限,这凸显了AI基础设施创新的价值。
然而,在供需之间,依旧有着结构性的失衡。一边是创业者喊着“不够用,价格贵”,一边是算力厂商喊着“赚钱难、跑通累”,中间的鸿沟,正是Token工厂想要填补的空白。
一位深耕企业级智能体领域的创业者告诉《IT时报》记者,他们今年帮客户落地智能体项目,客户最关心的问题已经从“能做什么”变成了“Token要花多少钱”。“以前谈AI,大家兴奋的是能力,现在热潮褪去,开始算账了。”
大模型领域的“杰文斯悖论”还在持续:Token越来越便宜,需求规模反而爆发式增长,算力总支出还在持续增加。WAIC 2026上,Token工厂正从概念展示落地为实体产品。谁能在Token这个“新石油”的炼化链条上跑得最快,谁就可能成为AI时代最大的赢家。
