7月25日早间,Anthropic正式发布了新一代旗舰大模型Claude Opus 5。该模型兼顾了“深思熟虑”与“主动响应”的特点,在性能上极为接近Claude Fable 5,但价格却只有后者的一半。这一巨大的价格优势引发了网友的热议:“如果跟Fable 5差不多,那为什么还要花双倍的价格用Fable 5?”
回到模型本身,在拿手的编程领域,Claude Opus 5在Frontier-Bench和GDPval-AA等评估中取得了SOTA成绩,不过在网络安全任务上仍落后于Mythos 5。Anthropic此次既大力宣传新模型,又给此前大热的Fable 5和Mythos 5留足了面子,可谓“端水大师”。
价格方面,Claude Opus 5定价为输入每百万Token 5美元,输出每百万Token 25美元(与Opus 4.8持平)。开发者可在API中使用claude-opus-5。快速模式运行速度约为默认速度的2.5倍,但价格为基础价格的2倍。此外,Claude还更新了两个处于测试阶段的功能:对话中途更换工具提示词缓存不失效、API自动降级处理(遇到被安全分类器标记的请求时)避免请求直接被拒绝。
对于Opus 5的发布,网友讨论度很高。有人调侃Anthropic的拿手好戏“重置”,也有人发现Opus 5的写作风格跟4.8很像,跟Fable 5完全不是一个模式,戏称其为“Fable 5.1”。更有网友贴心的预测,关于“教你用Opus 5”的文章又要泛滥了。
**01. 从高价值软件工程到科研、视觉输出:性能与性价比成突出优势**
大家吐槽Claude最多的一个词,就是“贵”。这一次,在维持与前代产品Opus 4.8相同成本的前提下,Claude Opus 5实现了性能的大幅跃升。该模型的“思考程度/努力程度”设置支持用户灵活调节——既可以追求极致智能,也可以节省Token以获取更快、更廉价的结果。
在高价值的软件工程任务中,Opus 5表现优异。Frontier-Bench v0.1显示,Opus 5超越了所有其他模型,在降低单项任务成本的同时,性能达到了Opus 4.8的两倍以上。CursorBench 3.2测试中,在最高努力模式下,其性能距离Fable 5的峰值得分仅相差0.5%,但单任务成本仅为后者的一半;在High、Xhigh和Max努力模式下,Opus 5在相同成本下的性能表现均优于所有其他模型。
在知识工作与复杂问题解决任务中,Opus 5同样表现亮眼。ARC-AGI 3测试中,Opus 5的得分是第二名模型的3倍。Zapier AutomationBench测试中,在相同单任务成本下,Opus 5的通过率约为第二名模型的1.5倍,即使在最低努力设置下,其通过的任务数也超过了其他任何模型。OSWorld 2.0测试中,在任意给定成本下,Opus 5的表现均优于其他所有模型,仅需略高于三分之一的成本即可超过Fable 5的最佳成绩。此外,它在多项相关评估中均成为了性能最强且最具性价比的模型,包括HLE、AutomationBench、DeepSearchQA等测试。
在科学研究方面,Opus 5相比Opus 4.8带来了显著提升。在涵盖结构生物学、有机化学和生物信息学等领域的全部生命科学评估中,Opus 5的表现均优于Opus 4.8,有机化学任务得分比Opus 4.8高出10.2个百分点,蛋白质相关任务得分提升了7.7个百分点。最后,Opus 5具备了大幅增强的视觉输出生成能力,能够生成空气动力学风洞风流图解和细胞结构互动图示。
**02. 自我校验、迭代能力提升:写代码前更爱“动脑子”**
Lovable联合创始人Fabian Hedin认为,Claude Opus 5是Opus家族自4.5以来最大的一次飞跃。Opus 5在自我校验与审慎迭代方面能力提升显著,能持续优化直至任务成功。
在评估和早期测试中,我们及测试用户发现了许多体现Opus 5主动性与严谨性的典型案例。例如,在Frontier-Bench的一项任务中,模型收到一张机械零件图纸,要求编写代码在FreeCAD中重建3D模型,但任务故意未向模型提供直接查看图纸的接口。Opus 5的做法是:自行编写了一套计算机视觉处理管线,从原始像素中提取几何特征,进而完成了完整机械零件的重建,且多次重复实验均告成功;而其他竞争模型尝试5次无一成功。面对一款热门开源包管理器中的真实Bug,Opus 5找到了根本原因,并修复了社区补丁遗漏的边缘情况;而竞争模型仅修复了表面症状。某交易公司的工程师使用Opus 5在单次会话中为一个新交易所构建了市场数据接入源,甚至自己构建了一套测试套件,用以检查代码是否准确解析了交易所数据。
Anthropic还发布了一些业内知名人士对Opus 5的评价。Cognition CEO Scott Wu提到,Opus 5在自家Devin软件中,在困难问题的调试与根因分析任务中表现出色。Zapier CEO Wade Foster提到,Claude Opus 5在未增加Token消耗的前提下拿下了Zapier AutomationBench榜首,100%完成了端到端的客户流失预防流程。JetBrains IDE AI负责人Denis Shiryaev看来,Opus 5最令其印象深刻的是判别力与决策力,其在写下代码前会更深入地思考,在规划阶段就能捕获自己的逻辑缺陷,这是解题能力的一次重要跨越。
**03. 安全性更高、更不容易被骗:重点限制漏洞利用能力**
在部署前的测试中,Anthropic自动化行为审计表明,Opus 5是其迄今为止对齐程度最高的模型。它比Opus 4.8、Sonnet 5或Fable 5更符合《Claude’s Constitution》,欺骗行为发生率最低,且最不容易被误导或诱导滥用,在避免可能产生不可逆副作用的轻率行为方面是目前Anthropic最安全的模型。
虽然与Opus 4.8一样,Anthropic特意避免在网络攻防任务上训练Opus 5,但该模型在相关任务上的表现仍有显著增强,在寻找网络安全漏洞方面已逼近Mythos 5。不过在漏洞利用方面,它依然大幅落后于Mythos 5。在安全拦截上,Opus 5的网络安全分类器限制相对比Fable 5更加宽松,允许Opus 5在源代码中查找漏洞,但会拦截“基于二进制”的漏洞扫描、渗透测试以及Exploits生成,针对拦截请求,系统默认会自动退回至Opus 4.8。在生物领域,Opus 5延续了与Opus 4.8类似的安全防护体系,据称是目前可用于科学研究的最强通用模型。
**04. 结语:国内模型爆发,Claude“性价比”路线加码**
Claude Opus 5这次是性能与性价比双重提升,在核心的编程、复杂推理、知识工作中提升显著,性价比优势突出,行业关注的自我校验迭代能力也有所提升,Anthropic在安全性方面花了比较大的篇幅解读。
当前国内开源、闭源模型“爆更”给海外大模型厂商带来显著压力,不少海外科技巨头逐渐转向中国模型,加码“性价比”,或许会成为海外大模型厂商后续的重要策略之一。
