17日凌晨,Kimi K3发布,引发全网刷屏,开源AI迎来了第二次“DeepSeek时刻”。外媒Axios评论称,K3的定价远低于其挑战的高端模型,不禁让人质疑美国AI公司的高价策略还能维持多久。巧合的是,就在此时,两大巨头正陷入一场激烈的客户争夺战。
此前,奥特曼在X平台上发文,没有先提新模型,而是先致歉:“过去12个月里,我们的表现并不理想,这主要是我的过错。”此前一直带领OpenAI与Anthropic贴身肉搏的他,公开将过去一年定性为“不够好”,并主动揽责,这本身就十分反常。但真正让全网炸裂的,是后半句。
奥特曼话锋一转,表示OpenAI即将迎来“有史以来最出色的12个月”,团队表现出色,“正在迎来让他们满意的结果”。奥特曼口中的“有史以来最出色的12个月”,到底押注的是什么?全网第一反应几乎是同一个:GPT-6是不是要来了?
几天内新增了300万活跃用户,“关掉推特,赶快去忙正事”。与奥特曼的推文遥相呼应的是,OpenAI Codex负责人Tibo在16日发布了一个900万活跃用户的新数字。将活跃用户数叠在一起看:2月,Codex还不到100万;7月12日600万,14日800万,到16日,Codex和ChatGPT Work合计突破900万。四天,多了300万人。Tibo在推文中说,本来想早点把额度调回来,结果被团队为保系统不崩、稳定运行而忙的“数以百万计的任务”给绊住了。帖子结尾他还提醒大家额度再过几分钟就恢复了,多去忙自己的正事,别总刷推特了。说白了,就是用户涨得太猛,工程团队正连轴转着堵窟窿。
这让人想起几个月前Anthropic CEO达里奥的“凡尔赛”。今年5月,达里奥在开发者大会上说,公司原本按每年10倍增长做规划,结果一季度的收入和使用量按年化算,暴涨了80倍:算力紧张就是这么来的。他半开玩笑地抱怨:真希望80倍别再继续了,太难扛,盼着回到正常一点的数字,“区区10倍”就好。两个AI巨头,一个连轴转堵窟窿,一个嫌自己涨太快。智能体的火,烧得比谁的规划都快。
同一周,两家抢着给你送额度。奥特曼这条认错推文,恰好落在OpenAI与Anthropic正打得火热的一场消耗战里。ChatGPT Work发布后没几天,OpenAI临时取消了Plus、Pro、Business的5小时使用限制,还一轮接一轮重置用户额度:先给约50万用户,再铺到700万用户,人人补一次。Anthropic也毫不示弱。它把Claude 3.5 Fable的付费访问又延长了一次,同时把Claude Code的周额度上调50%,两项都续到7月19日。一边取消限制、疯狂送额度,一边增加访问额度、提高上限。表面上,两家都在宠用户,实际上是在抢用户。
往深一层看,这是智能体时代的一场军备竞赛:谁能在这波狂热里把用户留住,谁就能攥住更多真实的长任务数据。最值钱的东西,就是智能体替你干上几个小时活、产生的真实使用数据。谁的额度更松,谁的用户和使用量就更多,谁收到的数据也就更多。OpenAI的首席财务官已经把这套算法用到了对手身上。按OpenAI给出的口径,在长周期工程任务基准DeepSWE v1.1上,开到最高推理档的GPT-5.6 Sol拿到72.7%,压过Claude 3.5 Fable的69.9%;而估算API成本,比对方低36.2%。更能得分,还更便宜——这正是“每块钱买到多少活”想证明的东西。同时输出token减少54%,预估API成本降低36.2%。有意思的是,被点名的Anthropic几乎在同一时间做了另一件事:把Fable的付费访问再延一次,Claude Code周额度上调50%,都续到7月19日。一个用图表证明自己更划算,一个直接把闸门开大让你自己试。
这也解释了,为什么两家宁可扛住系统压力,也要拼命把使用量往上推。高强度的真实使用本身,就是护城河。不过,也有人从这波狂飙里嗅出了别的味道。经济学者Jeremy Nguyen评论“Codex和Claude Code同一天重置额度”时说,也许多年以后,我们会跟年轻人讲起早期这场“智能体token大战”,讲token当年被补贴得有多疯。他翻出了互联网泡沫的旧账:那时候,有创业公司为了让你在电脑上挂个广告条,每月倒贴你几百美元。他的问题很实在:如果这样的窗口只有一次,该怎么趁现在,把Codex和Claude Code用到值回票价?而这条赛道上,Anthropic的Claude Code同期的动作不断,面向金融、工程的企业智能体早已落地。两家的智能体之战,才刚刚打响。
认错几小时后,CFO递上一张账本。巧的是,就在奥特曼发帖的同一天,OpenAI官网上线了另一篇文章。作者不是奥特曼,是CFO Sarah Friar。Friar开篇就说,她在各处听到CFO们问的是同一个问题:怎么让AI这笔钱花得更值。她给出的答案是一把新尺子——Useful Intelligence per Dollar,每块钱买到多少有用的智能。过去衡量软件成功,看的是采纳率:买了多少个席位、多少人活跃、续费了多少。Friar说,AI要换个更狠的口径:看干成了多少活。她甚至直接点破了“token单价”这个幻觉:最低token价格 ≠ 最低结果成本。便宜的模型token是便宜,但可能要试更多次、耗更多时间、让人多审几遍;贵的模型一次过。真正该算的,是每完成一个合格任务的总成本,真正该计算的是全成本公式 =(模型调用费用 + 计算资源 + 人工审查时间 + 重试次数 + 返工成本)÷ 成功达标任务数。真正决定性价比的,从来不是单次token价格,而是一次成功任务的完整成本。
GPT-5.6家族(Sol旗舰、Terra平衡、Luna高速低价)正是为此而生。一个支持团队的“完成”,是客户问题被解决;工程团队的“完成”,是代码改动通过测试;法务团队的“完成”,是合同审完且没出错。读到这儿,回头看前面那场额度大战,味道就变了。OpenAI取消5小时限制、一轮轮重置额度,Anthropic上调Claude Code周额度50%——这不只是补贴用户抢数据。当计价单位从“席位”和“token”变成“完成的工作”,送额度就不是让利,是换口径。谁先让所有人习惯用“干成多少活”来算账,谁就重新定义了这个市场怎么比。能力赢得首次使用,可靠性让AI成为工作方式本身。随着使用量增长,每一美元AI是否在为你创造更多价值?答案藏在计算基础设施飞轮里:更好基础设施 → 更强模型 → 更好产品 → 更高采用 → 更多收入 → 持续投入下一代研究与算力。当同一工作流随时间推移,成功任务数增长速度超过总成本,且质量不降反升时,“每美元有用智能”就实现了正向复利。
双雄争的是谁当上你的AI同事。如果将视角放远,看得更清楚。年初先出手的是Anthropic。Claude Code在开发者里一战封神,紧接着的Cowork把智能体从程序员推向普通知识工作者,在“AI办公”这块抢下先手。OpenAI在7月9日发布的ChatGPT Work,几乎是贴着Cowork的卖点打,内置Codex,还捎带上线了当天同步发布的最新模型GPT-5.6 Sol。一句“帮我建个项目追踪表”,它就交出一张18个项目、29个待办事项的甘特图:这不是聊天,是交活。这次变的不是参数,是形态。过去用ChatGPT是你提问、它回答;现在你只给一个目标,剩下的它自己来:拆任务、调工具、翻你的文件和应用,一口气干上几个小时,直到把活儿真做出来。官方一句话说透了定位:ChatGPT不再只是回答问题的机器,而是你攻坚复杂工作的伙伴。OpenAI也拿整个公司做了实验:如今内部几乎100%的团队,从财务到销售,都在用ChatGPT Work和Codex干活。此外,和Anthropic相比,OpenAI手里还多一张短期无解的牌:分发。Cowork得让用户主动下载一个桌面端;而把智能体揉进ChatGPT,意味着超9亿周活用户打开那个最熟悉的App,就已经在用智能体了。奥特曼自己的说法是,agentic产品的使用量一周环比涨了2.5倍。这条曲线,正是撑起他“下一年最强”的底气之一。
回到奥特曼那句预告。他押注的大概率不是一款叫GPT-6的新模型,而是一次更彻底的形态切换:让AI从“回答问题”,正式变成“替你干活”。而Friar那把尺子,正是为这次切换准备的——当AI开始干活,衡量它的就不再是参数,而是干成了多少活、花了多少钱。一个在前台喊话,一个在后台改账本。这场竞争最后的胜负,或许不取决于谁的模型更强,而取决于谁先真正住进每个人的工作流里,成为你的AI“同事”。
