一觉醒来,OpenAI 给 GPT-5.6 Luna 的一记重拳。价格直接腰斩八成——每百万 Token,输入 0.2 美元,输出 1.2 美元。尽管成本大降,性能却未缩水。在专业评测 Agents’ Last Exam 中,Luna 不仅反超 Anthropic 旗舰 Fable 5,单任务成本更是仅为对方的 1%。更令人惊叹的是,这轮降本的背后,是 GPT-5.6 Sol 亲自下场,重写并优化了运行自己的生产内核,再加上其他优化手段,成功将端到端服务成本压低了 20%。这标志着 AI 正在开始“自我进化”。
01、三档模型价格洗牌
GPT-5.6 分为三档:Sol 为旗舰,Terra 为日常平衡,Luna 则主打速度与低价。此次调整主要针对后两者。
对比新旧价格,Luna 的输入价格从 1 美元降至 0.20 美元,输出从 6 美元降至 1.20 美元,降幅高达 80%;Terra 的输入从 2.50 美元降至 2 美元,输出从 15 美元降至 12 美元,降幅约 20%。Sol 的价格保持 5 美元和 30 美元不变。
对于开发者而言,Luna 的大幅降价意味着批量调用成本几乎可以忽略不计。过去需要精打细算的 token 费用,如今在 Luna 面前变得微不足道。订阅用户也受益匪浅,虽然月费不变,但积分消耗减少,能处理的任务更多。
此外,Sol 新增了 Fast 模式,替代原有的 Priority Processing。该模式提供最高 2.5 倍的速度,价格翻倍,但智能水平保持不变。在 Codex 中对应 /fast 指令,此前标记为 priority 的请求自动切换。对于延迟敏感的场景,这相当于一个用金钱换取速度的开关。
App 中的“替我审核”功能也借此机会升级,改用 Luna 提前拦截主 Agent 的高风险动作,将成本降低了约 10 倍。
此次降价底气十足,源于 GPT-5.6 Sol 通过 Codex 接入生产推理栈,对自身系统进行了深度优化。Codex 负责人 Tibo 将这一过程概括为两步:首先训练出足够强大的模型,随后利用该模型反向优化其自身的基础设施、推理栈和内核。
具体而言,GPT-5.6 针对四个关键领域进行了优化:
1. 负载均衡:OpenAI 的请求按地域、容量和加速器类型分发,集群内再按负载、上下文长度和缓存分配。Sol 通过分析生产流量,发现了工程师此前忽略的负载不均问题,并测试了新的路由策略。
2. GPU 内核:模型的前向传播依赖内核执行数学运算,但内存搬运、同步和数据布局的不合理会导致 GPU 空闲。Sol 利用 Triton 和 Gluon(OpenAI 维护的 GPU 编程语言),自主重写并优化了生产内核,通过预计算、跳过和并行处理等手段,将端到端服务成本压低了 20%。
3. 推测解码:该技术利用更小的 draft 模型先行预测 token,主模型并行验证,猜对即可多输出。Sol 针对这一 draft 模型设计了数百次架构实验,调整尺寸、结构和特性,甚至亲自启动并监控训练流程以解决硬件故障和稳定性问题。最终,token 生成效率提升了超过 15%。
4. KV 缓存与配置调优:批处理、分片和 KV 管理的最优配置高度依赖负载,配置空间巨大。Sol 分析生产负载,生成并评估候选配置,将过去难以调优的参数推向极致。
值得一提的是,Sol 编写的内核上线前必须通过 FpSan(浮点数消毒器)的严格检查,确保结构和数据流无误。
内部数据显示,GPT-5.6 内测阶段,每位活跃研究员的日均 token 输出是 GPT-5.5 峰值的两倍以上。过去半年,内部代码推理研究算力占比增长了 100 倍,内部智能体 token 用量增长了约 22 倍。节省下来的算力,直接成为了降价的底气。
20 美分,反超 Anthropic 旗舰
不夸张地说,如今的 GPT-5.6 系列已正式站在了价格与性能效率的帕累托曲线上。在横跨 55 个领域、评估长周期专业工作流的评测 Agents’ Last Exam 中,Luna 的得分直接反超了 Anthropic 的旗舰 Fable 5。单任务成本仅为对方的 1%,而速度却高达 9 倍。
第三方评测机构 The Agent Report 的拆解也证实了这一点:GPT-5.6 三档模型在 Agents’ Last Exam 上均高于 Fable 5。此外,在 DeepSWE 评测中,Luna 每美元能换取约 24 个基准分,而 Fable 5 仅约 3.2 分,效率差距达 5 到 7.5 倍。
02、收入加速,Codex 杀回来了
综合来看,促使 GPT-5.6 发布三周便大幅降价的压力主要来自两方面:一是开源模型的价格碾压,中国模型的 token 成本整体比美国同行便宜最高 9 倍;二是 Anthropic 在企业市场的猛攻,Claude Code 今年初在编程工具市场领先,5 月公布的年化收入超过 470 亿美元。
但比降价先到的,是收入的爆发。在 7 月 29 日的内部会上,CFO Sarah Friar 表示——Codex 和 ChatGPT Work 加起来,活跃用户已经过了 1000 万,两周翻了近一倍。基于此,OpenAI 单 7 月一个月的年化经常性收入,直接超过了整个第二季度的总和。这其中,有一部分增长正是从 Anthropic 那边抢来的,原因在于 Claude Code 的账单过高,用户纷纷开始寻找替代方案。
然而,虽然价格战能拉升使用量,也会压低利润率。EMARKETER 分析师 Jacob Bourne 指出,“疯狂的刷 token 时代结束了”,企业开始更注重清晰的投资回报率。但 OpenAI 不怕降价,因为它通过模型自身的优化提升了效率。最终,决定格局的关键在于,谁能在同样一张卡上榨出更多的智能。
