OpenAI 掀起新一轮 API 价格战,GPT-5.6 模型大跳水
入门级模型 Luna 的价格直接腰斩,每百万 Token 输入价格从 1 美元降至 0.2 美元,输出价格从 6 美元降至 1.2 美元。折合人民币计算,输入价格从约 6.8 元降至 1.35 元,输出价格从约 40.6 元降至 8.1 元。
定位为「日常干活主力」的 Terra 模型也进行了 20% 的降价,输入和输出价格分别降至 2 美元和 12 美元,折合人民币约为 13.5 元和 81.2 元。
旗舰模型 Sol 则保持原价,但新增了 Fast Mode,速度最高可达标准模式的 2.5 倍,且无需额外付费。
随着之前 Codex 的用量重置,这次降价也紧随其后,OpenAI 这一波操作显然是要卷死竞争对手,价格战已全面白热化。
OpenAI 表示,降价的原因在于 GPT-5.6 Sol 参与了自家生产系统的优化,从而实现了降本增效。GPT-5.6 Sol 参与了自身改进,效率取得了飞跃式提升,因此回馈新老用户。这种模型通过自我优化来降低成本的模式,OpenAI 也是驾轻就熟。
**当前 GPT-5.6 三款模型 API 价格一览:**
* **GPT-5.6 Luna**:输入 0.2 美元/百万 Token,输出 1.2 美元/百万 Token
* **GPT-5.6 Terra**:输入 2 美元/百万 Token,输出 12 美元/百万 Token
* **GPT-5.6 Sol**:输入 5 美元/百万 Token,输出 30 美元/百万 Token
此次降价中,Luna 的降幅最大,属于「大跳水」级别。其输入价格已与上一代 GPT-5.4 nano 持平,输出价格甚至更便宜 0.05 美元。不过,两款模型的应用场景有所不同。GPT-5.4 nano 主要面向分类、信息抽取和排序等简单高频任务,而 GPT-5.6 Luna 则被定位为面向成本敏感型工作负载的模型,支持调用工具、处理长上下文以及执行多步工作流。
简而言之,OpenAI 正在将支撑 Agent 工作的模型,卖到过去简单小模型的价位。Terra 的降价相对克制,Sol 则保持原价并增加了 Fast Mode。
**新变化:Agent 工作流的成本革命**
此次调整同样覆盖了 Codex 和 ChatGPT Work。订阅价格保持不变,用户额度总量也不增加,但调用 Terra 和 Luna 时,消耗的额度将相应减少。这意味着同样一笔订阅费,现在可以让模型干更多的活。
此外,OpenAI 还将 ChatGPT 和 Codex CLI 里的 Auto-review 模型从 GPT-5.4 升级为 GPT-5.6 Luna。Auto-review 负责后台检查代码和修改结果,属于典型的高频 Agent 任务。结合模型升级和 Luna 降价,OpenAI 预计其成本将降至原来的约十分之一。
便宜模型不再只负责分类、抽取等传统「杂活」,而是开始进入代码审查、后台监控等需要判断和工具调用的环节。
目前三款模型的定位非常清晰:
* 预算敏感、调用量大的任务交给 Luna;
* 普通日常工作交给 Terra;
* 高难度任务继续使用 Sol;
* 如果连等待速度都嫌慢,再花一倍的钱购买 Fast Mode。
**GPT-5.6 参与自我降本**
为何突然降价?OpenAI 解释称,原因是 GPT-5.6 Sol 参与了自家生产系统的优化。它通过重写和优化部分生产环境 GPU Kernel,设计并运行数百次 Token 生成实验,并参与监控训练,在出现问题时介入。
最终成绩十分亮眼:生产 GPU Kernel 优化让 GPT-5.6 端到端服务成本下降 20%;改进推测解码,让 Token 生成效率提升 15% 以上。
GPU Kernel 可以理解为模型在 GPU 上执行具体计算任务的底层程序。模型本身无需改变,只要这些程序写得更高效,同一块 GPU 就能更快完成计算,处理更多请求,单次调用成本自然下降。
推测解码则是在生成答案时,先批量「猜」出接下来可能出现的 Token,再交给主模型验证。猜得越准,需要逐个生成和等待的步骤就越少。
这两项优化都没有降低模型能力,却能让同一个模型跑得更快、更便宜。不过,OpenAI 也强调,整个过程仍然由人类主导。模型可以写代码、跑实验、监控异常,但目标设定、结果应用以及代码是否进入生产环境,依然需要「Human in the Loop」。
**闭环已现:降价飞轮启动**
最后,还有一个重要的落点:Agent 工作流。
打折最狠的 Luna,并不只是用来做分类、抽取的传统小模型。按照 OpenAI 的定位,它可以调用工具、执行多步任务,主要面向高频、成本敏感型工作负载。因此,Luna 降价 80%,也是在降低 Agent 长期运行的门槛。
这让原本因成本过高而不能频繁执行的审查、验证和监控任务,有机会变成工作流里的常规步骤。再结合 GPT-5.6 参与优化自身生产系统,一套新的循环出现了:
模型参与提高运行效率 -> 成本下降 -> 价格降低 -> 模型进入更多高频工作流 -> 调用规模扩大 -> 推动下一轮效率优化。
OpenAI 这套降价飞轮,已经雏形初现。这一通操作下来,现在的压力直接传导给了竞争对手:’轮到你们了。’
参考链接:[1]https://x.com/OpenAI/status/2082878156483219672 [2]https://x.com/sama/status/2082880720989532597
