过去两个月,AI行业突然掀起了一场集体“发券”热潮。7月31日,OpenAI宣布将GPT-5.6 Luna的API价格下调80%,Terra降价20%,Codex和ChatGPT Work中调用这两款模型的额度消耗也随之减少。一时间,Token仿佛变成了随处可见的优惠券,既是新品试喝券,也可能是系统故障后的补偿券;既能装入会员套餐,也能做成“中杯、大杯、超大杯”的套餐。这不禁让人联想到外卖界的“奶茶大战”:平台争相发放优惠券,看似是让利给用户,实则争夺的是用户的消费习惯。
过去,AI公司的竞争主要集中在参数规模、榜单排名和模型发布会等硬核领域。但随着Agent用户激增、头部模型能力差距缩小以及迁移成本下降,单纯的技术竞赛已沦为入场券。如今,AI公司面临一个更直接的问题:当用户可以随时在不同AI工具间切换,如何让他们留下来?于是,发券成了争夺用户的新手段。这轮Token促销中,一个标志性信号出现在5月20日左右。当时,OpenAI向YC创业公司提供最高200万美元的Token,条件是对方拿出一部分股权。OpenAI实际上是用算力参与投资,既押注这些创业公司,也希望它们从一开始就使用自家模型,日后成为付费客户。
6月,Token的用途变得更加像电商优惠券。因系统异常多扣额度后,OpenAI两次统一重置用户额度,并额外赠送一次可留待以后使用的重置机会,相当于送了一张“续杯券”。Anthropic则采取了另一条路,将限时免费的新品体验活动连续延期,并最终将其纳入高阶套餐,让原本用于推广的免费体验变成了一项长期会员权益。DeepSeek的动作更为直接,先永久降价75%把开发者拉进来,随后又提出峰谷定价策略,用分时价格控制使用量。MiniMax则直接将Token打包成20美元、50美元和120美元三档套餐,对应不同用量,像极了奶茶店菜单里的中杯、大杯和超大杯。7月最后一天,OpenAI也直接加入了降价行列,宣布GPT-5.6 Luna的API输入和输出价格均下调80%,Codex和ChatGPT Work的订阅价格及额度总量虽未变,但使用Luna和Terra时扣除的额度减少。
这场“Token奶茶大战”不仅发生在会员套餐里,对高价值企业客户,厂商送得更加直接。据《华尔街日报》报道,AI客服平台Pylon的CEO透露,公司今年以来从一家模型供应商处获得了价值约160万美元的免费Token,另外两家也分别送出数万美元额度,甚至还有厂商提供数月无限量免费使用权。模型降价和赠送额度并不新鲜,但在过去,这类活动通常集中在新品发布期或作为开发者扶持手段,热闹一阵便会结束。而最近两个月,送Token的方式层出不穷,Token不仅承担了类似优惠券的作用,被系统性地用于拉新、留存和补偿,更成了争抢企业客户的投标筹码。
无论厂商如何包装这一行为,都在说明同一件事:AI公司已不满足于按量计价,而开始用更“互联网”的方式争夺用户。这背后是单一订阅制越来越难覆盖差异巨大的使用强度。轻度用户看重低门槛,重度用户则在执行长任务时患上额度焦虑。于是,会员档位、流量包、Credits和峰谷定价共同出现。AI公司不再只是卖模型,也开始研究消费巨头们熟知的生意:如何让用户第一次下单,之后又该用什么方式让TA多买一杯,以及喝完以后给TA个什么理由回来。
AI公司的战场虽然仍在技术竞赛,但明显多了一层商业化较量。厂商突然在Token上加码,背后有两个变化:一是Agent用户迅速增加,单个用户消耗的额度越来越高;二是头部模型在不少常用任务上的差距缩小,用户换平台比以前容易。首先,AI用户仍在快速涌入。截止6月初,Codex每周活跃用户已经超过500万,是2月桌面应用推出时的6倍以上。更值得注意的是,非开发者约占20%,增速超过开发者的3倍。编程Agent的用途已超出写代码,整理资料、写文档和分析数据也成了常见用法,甚至有人会把全流程交给它完成。
用户消耗Token的方式也变了。根据OpenAI官方数据,到今年5月,80.6%的Codex个人用户至少提交过一次相当于人类工作30分钟以上的任务,25.6%提交过相当于8小时以上的任务,超过10%的用户每周同时管理过3个以上Agent。过去,用户问一个问题再得到答案,流程简单且Token消耗量相对较小。现在,Agent一项任务可能持续数小时,Token的消耗从“2G时代”突然迈向了“5G时代”。Anthropic对约40万次Claude Code会话的分析也显示,用户平均每周使用约20小时。随着Agent从偶尔尝鲜到进入工作流程,额度从附赠福利变成了刚需。厂商开始争夺那些使用频率高、付费周期长的用户。截止今年2月,Claude Code年化收入已经超过25亿美元,较年初翻倍,企业订阅数量增长4倍,企业客户贡献了超过一半收入。
问题是,这些用户并不忠诚。AI客服平台Pylon的CEO对此直言不讳:“我完全看不到任何忠诚度。”过去购买传统软件选定一家并持续付费的时代已经过去,企业现在通常会同时接入几家模型,具体任务交给哪一家,主要看效果和价格。Cursor的产品本身就是“与模型无关”的,用户可以在OpenAI、Anthropic、Google和开源模型之间切换。其负责人称,过去一项任务的最佳模型可能几个月才变化一次,现在每周都可能更换好几次。这也解释了厂商为什么急着多送一些Token。Agent用户正在快速增长,但多数人的使用习惯尚未定型,企业也没有决定最终把哪家模型接进业务。厂商争的是谁先成为个人用户的常用工具,以及企业工作流里的默认模型。
模型能力负责把人吸引过来,补贴则负责给用户一个“先别走”的理由。技术只是入场券,AI公司开始补商业课。但Token优惠和“奶茶券”有一个根本区别:奶茶多送一杯,成本相对清晰可控。但Token多送一亿,最后会转化成多少算力支出很难提前算清,而算力在当下依然非常珍贵。于是,有意思的现象出现了:AI公司一边发券,一边限流。Anthropic与SpaceX达成算力合作,Claude Code的5小时额度才得以翻倍,高峰期也不再下调限额。Fable 5恢复后,最多只能占付费用户周额度的50%,超出部分需要购买Credits。免费体验从一开始就画好了成本边界。MiniMax的大额套餐同样不是无限使用,它同时设置5小时额度、周额度、Agent并发上限和高峰期限流。OpenAI此次降价同样保留着清晰的成本边界,旗舰模型Sol价格未动,API新推出的Fast模式则以两倍标准价格换取最高2.5倍的速度。
更棘手的是,补贴能带来拉新,却很难买来忠诚。厂商希望用免费Token换来长期调用,但企业也在迅速学会“薅完就走”。Pylon一边从多家供应商手里领取免费额度,一边明确表示看不到任何忠诚度。Cursor、Zoom和Hex则把多个模型同时接入工作流,随时根据价格和效果重新分配任务。厂商想把用户锁进一个生态,企业却在努力不被任何一家锁定。微软对数万名工程师的研究发现,编程Agent的第一次使用往往由同事带动,但后续是否持续使用,主要取决于工程师是否真的有足够的编程需求,持续使用者合并的PR数量提高约24%。真正能留下用户的,仍然是产品能否进入日常工作。
换句话说,优惠券只能把奶茶送到用户手里,不能保证他从此每天都喝。AI公司接下来要同时做两门生意:一边像消费平台一样用补贴做拉新和留存,一边像云厂商一样调配算力并守住毛利。既怕用户跑,又怕用户用得太多,实在是一种别扭的处境。Token越送越多,用户却未必留下;用户真留下来,算力账单又会跟着上涨。最棘手的是,调用量和成本可以一起增长,收入却未必跟得上。优惠总会结束。等到各家不再靠送额度拉人,还能留住用户并把这门生意做下去的,究竟是谁?
