7月25日凌晨,Anthropic正式发布了Claude Opus 5。乍一看,这像是Opus 4.8的继任者,定位在Sonnet之上、Fabel之下。然而,实际数据却令人大跌眼镜:定价仅为5美元/25美元的Opus 5,在编程、自主搜索、计算机操作及企业流程等关键基准测试中,全面超越了定价10美元/50美元的Fabel 5,且成本仅为后者的一半。Anthropic官方宣称其“接近Fabel 5的智能,价格减半”,但自家的基准测试图表显示,Opus 5在至少四项核心评测中明显领先Fabel 5,且是在更低成本下实现的。
01、被“次旗舰”反超的“旗舰”
先看编程能力。Frontier-Bench v0.1是当前最贴近企业开发团队实际工作的基准之一,要求模型在终端中自主编写、运行和调试代码。Opus 5得分43.3%,Fabel 5仅33.7%,差距近10个百分点,属于碾压级别。在CursorBench 3.2上,Opus 5在最高推理强度下达到Fabel 5峰值的94.5%,单次任务成本减半。在自主搜索上,Opus 5得分90.8%,Fabel 5为87.4%。计算机使用方面,Opus 5以约三分之一成本超越了Fabel 5的最优成绩。企业业务流程自动化上,Opus 5得分26%,Fabel 5仅17.4%。科学领域同样强劲,有机化学任务比Opus 4.8高出10.2个百分点,蛋白质任务高出7.7个百分点。在“人类最后考试”Humanity’s Last Exam上,开启工具后Opus 5得到64.7%,Fabel 5为63.9%。但真正让整个AI研究圈震惊的,是ARC-AGI 3的成绩。ARC-AGI 3是François Chollet设计的衡量“流体智能”的基准,不依赖训练数据,而是将模型扔进陌生环境让其摸索。人类能完成100%的任务。今年3月发布时,最强AI仅得0.37%。到Opus 5发布前,公开最强成绩是GPT-5.6 Sol的7.8%。而Opus 5直接拿到了30.2%,是GPT-5.6 Sol的近四倍,Opus 4.8的二十倍。Vellum AI的分析直言:“这个数字让所有人都停下了滚动。”
02、它不只是分数高
基准数字揭示了Opus 5的得分,但Anthropic公布的案例展示了它是如何做到的。一个3D建模任务中,模型仅凭一张机械零件图纸,就自主编写代码重建完整的FreeCAD模型。在此之前,没有任何模型能完成此任务。Opus 5不仅完成了全过程,还搭建了配套测试工具,逐一校验数据解析逻辑,反复修正直至通过。在没有任何人工干预的情况下,它自主完成了从设定目标、规划步骤、编写代码、测试输出、发现错误、回溯修正到再次测试的全闭环工程验证。Zapier CEO Wade Foster透露,团队用Opus 5处理客户健康度表格,完成了全套客户流失预防流程,包括标记风险账户、通知负责人和整理报告,实现了100%完整交付。Box CTO Ben Kus指出,Opus 5在专业内容处理上整体比Opus 4.8提升8%,数据分析提升11%,尽职调查提升17%。一家金融团队负责人测得准确率高9个百分点,周转次数少三分之一,耗时少60%。法律AI团队负责人Niko Grupen发现,Opus 5在保持质量的同时,比Opus 4.8最高推理强度下少生成了26%的token。更少的token、更少的交互、更少的人工监控,这就是Opus 5对“性价比”的真正定义。
03、没人预料到的30.2%
回顾ARC-AGI 3的冲击力。今年3月,Gemini 3.1 Pro领先得0.37%。到Opus 5发布前,公开最强成绩是GPT-5.6 Sol的7.8%。而Opus 5发布当天直接拉到30.2%。Anthropic称其是“次优模型的三倍”,但这可能低估了,因为GPT-5.6 Sol是在最大推理强度下取得的,而Opus 5在标准推理设置下就做到了30.2%。ARC-AGI 3测试的是未知问题的应变能力,奖励的不是“做过类似的事”,而是“从没训练过也能做”。30.2%意味着Opus 5确实在通过交互推导陌生规则,而非模式匹配。AI正从“超强模式匹配器”向“自主推理系统”转变。
04、大模型定价逻辑的变革
为什么Anthropic要发布一款在核心指标上碾压自家“旗舰”的模型,还只卖一半的价格?这需要看Opus 5周围的定价坐标。Fable 5定价10美元/50美元在2026年7月显得孤立。45天前发布的Fable 5确实“神话级”,但Opus 5用不到一半的价格在关键场景超越。Anthropic面临困境:Fable 5的高价策略正在被市场抛弃,竞争对手Kimi K3的开源攻势正在蚕食。Anthropic选择主动出击,用Opus 5将旗舰能力注入中端产品线,正面迎战性价比战场,同时让Fable 5守住“极致推理”利基市场。Opus 5的使命是证明Anthropic还能收前沿溢价,但给出的回答是“不收了”。前沿溢价的门槛被抬高了——你得在5美元/25美元的价格点上拿出比Fabel 5更强的能力,才有资格谈溢价。
05、大模型定价逻辑的终结
Opus 5的发布宣告了“越贵越强”定价范式的终结。过去两年,行业默认逻辑是更强的模型=更大的参数=更高的成本。但Opus 5证明,更强的推理架构和更高效的训练方法,能让模型在价格不变甚至更低的情况下性能跳升一个量级。Frontier-Bench得分从21.1%跳到43.3%,ARC-AGI 3从1.5%跳到30.2%。这不是边际改善,是范式跃迁。“旗舰”正从能力标签变为价格标签。这给行业信号:如果不能持续拉开代差,明天就会被更便宜的模型超越。Anthropic主动拆掉自己的价格金字塔,预判了趋势。对于企业用户,Opus 5是2026年最值得评估的AI投入。但真正的变量在7月27日,Kimi K3开源全部权重。当2.8T参数的模型可以免费部署且性能逼近前沿,整个行业的定价地板将被击穿。Opus 5证明了“可以更便宜地做得更好”,Kimi K3将证明“可以几乎免费地做得差不多”。留给维持高溢价的窗口期正在以天为单位收窄。
