刚刚,OpenAI 与 Anthropic 几乎同步发布了重磅新模型。OpenAI 推出了 GPT-6 Sol 与 GPT-6 Luna,而 Anthropic 则发布了性能逼近 Fable 5.1 的 Claude Opus 5.5。这场隔空对决的核心,似乎都指向了一个共同的方向:在保持强大能力的同时,大幅降低使用成本。
OpenAI 表示,新推出的 GPT-6 Sol 和 GPT-6 Luna 脱胎于其顶级的 GPT-6 Astra 底座。如果说 Astra 侧重于探索前沿智能,那么 Sol 和 Luna 则专注于将 Astra 的核心推理与多模态能力规模化应用,并重构为更轻量、吞吐量更高的版本。最引人注目的是价格策略,Sol 和 Luna 的 API 价格直接“腰斩”,相比 GPT-5.6 降低了 50%。OpenAI 首席执行官 Sam Altman 在社交媒体上强调,这是推动“智能普及化”的必经之路,旨在让开发者摆脱昂贵的算力账单,真正关注“单任务成本”这一核心指标。
在性能测试中,GPT-6 Sol 表现亮眼。在 AutomationBench 测试中,即便在最高推理强度下,Sol 的表现也超过了 Claude Opus 5,且每个任务成本仅为 Opus 5 的九分之一。在事实准确性方面,Sol 的错误数量降至上一代的一半,接近 Astra 级别的可靠性。编程能力上,GPT-6 Sol 在 DeepSWE 测试中得分 68.8%,仅比 Claude Fable 5 的最高成绩低 1.1 个百分点,但成本降低了约 80%。此外,OpenAI 还针对 Agent 长任务场景优化了 Prompt Caching 机制,使默认缓存命中率更高,大幅降低长上下文处理的成本。
与此同时,Anthropic 发布了 Claude Opus 5.5。作为 5.5 系列的首款模型,其定位非常明确:大多数任务达到 Fable 5.1 的水平,但在典型任务中成本降低约 40%,输出速度提升超过 30%。在基准测试中,Opus 5.5 在 Terminal-Bench 4.0、FrontierCode 和 GDPval 等多项指标上均超越了 Fable 5.1。值得注意的是,Anthropic 没有简单地进行性能升级,而是大幅调整了定价策略:Opus 5.5 的输入和输出价格均低于 Fable 5.1,后者价格是前者的 2.5 倍。
Anthropic 还引入了 Adaptive Thinking 功能,默认设为中等推理强度,而非 Fable 5.1 的高强度。数据显示,在 FrontierCode 任务中,将强度调至最高只会使成本增加约 7.7 倍,而得分提升微乎其微。这表明,过度的推理预算往往导致无效的“空转”。Anthropic 通过降低缓存读取价格(降幅达 60%)和减少 Token 使用量,成功将单任务成本降低了 40%。
这场发布战揭示了一个深刻的市场趋势:AI 竞争已从单纯的能力突破转向规模化应用。OpenAI 提出“构建丰富的智能”,强调用户购买的是“完成的任务”而非 Token;Anthropic 则通过市场反馈意识到,企业用户对价格极其敏感,Fable 5.1 的使用率极低。可以预见,未来 AI 普及的速度将不再取决于模型 IQ 的高低,而在于谁能以最低的成本持续创造价值。面对这场激烈的竞争,网友们也纷纷期待厂商们继续“打下去”,将智能价格打到极致。
