今夜,Anthropic毫无预热,直接发布了Claude Opus 5.5。作为Claude 5.5系列的首款模型,它在性能上追平了Fable 5.1,但成本却比上一代Opus 5降低了40%,输出速度更是提升了30%。这一次,Anthropic直接打破了“性能强=成本高”的刻板印象,让每个人都能以更低的成本获得Fable 5.1级别的能力。用三个字概括:更强、更便宜、更快。
在智能体编程、计算机使用及知识工作上,Opus 5.5全面刷新了SOTA(最先进水平)。特别是在Terminal-Bench 4.0测试中,它取得了66.4%的成绩,将GPT-6 Astra和Fable 5.1远远甩在身后。在知识工作领域,GDPval-AA v2.1的得分高达1846 Elo,同样领先于对手。随着Claude 5.5的亮相,AI圈新一轮大战的火药味骤然拉满。Anthropic官宣不过两小时,OpenAI便迅速推出GPT-6 Sol和Luna迎战,AI模型之战,今夜正式打响。
距离Opus 5发布仅过去不到两个月,Claude此次“跳级发售”显然是直指OpenAI。在第三方机构Artificial Analysis的对比中,Claude 5.5和Fable 5.1均压过了GPT-6 Astra。在Anthropic自家的ECI指数上,Opus 5.5的得分甚至超过了被“雪藏”的Mythos 5.1。Vals AI的RSI指数显示,Opus 5.5在全球排名第一。
在编程能力上,差距进一步拉大。Terminal-Bench 4.0衡量的是AI在真实终端环境中完成复杂多步编程任务的能力,Opus 5.5以66.4%的成绩领先GPT-6 Astra 8.5个百分点。Fable 5.1为55.8%,Opus 5仅为52.3%。在FrontierCode v1.1测试中,Opus 5.5以54.4%险胜Astra的53.3%。最令人印象深刻的是CursorBench 4.0,该测试题目均来自真实Cursor会话中的复杂任务,Opus 5.5拿下57.8%,而GPT-5.6 Sol仅得41.7%。
狂飙写作的同时,Opus 5.5也治好了“啰嗦”的毛病。它学会了“结论先行”,不再堆砌废话,沟通效率大幅提升。Box的AI产品副总在体验后表示,Opus 5.5的token用量只有上一代的三分之一,啰嗦度降低了40%。
虽然Claude不擅长生图,但其3D和Agent表现令人惊叹。开发者DreW制作的30秒短片让网友感叹:“这比Astra更像AGI。”谷歌DeepMind的Ben Poole在纸上画了一个投石机和方块草图,Opus 5.5迅速将其转化为可发射、可砸塌方块的3D物理仿真。Anthropic大牛Addy Osmani则在Three.js中实时生成了骑自行车的鹈鹕动画。沃顿商学院的Ethan Mollick用同一套shader提示词,生成了暴雨中的哥特城市。在游戏生成方面,Opus 5.5同样表现优异,无论是涂鸦风格的FPS、可玩的Minecraft,还是基于安提基特拉机械装置的游戏,它都能通过纯代码实时生成画面和音效。
此次降价力度空前。输入和输出价格各砍20%,缓存读取价格降60%。官方宣称典型工作负载下整体便宜40%,输出快30%。但Artificial Analysis的测试揭示了一个反差:在最高负载下,Opus 5.5每解一道题平均生成11.9万个token,其中思考过程就占用了8.4万。相比之下,Opus 5为7.3万,Fable 5.1为7.8万,GPT-6 Astra仅为2.7万。这意味着Opus 5.5比上一代多想了60%,比Astra多想了4倍。单价虽降两成,但思考量暴涨六成,实际成本未必真的便宜。
在安全审查方面,Anthropic透露了一个细节:Opus 5.5在自动行为审计中越狱尝试减少了85%,且每次都会主动上报。然而,官方也承认,该模型经常敏锐地怀疑自己正在被人类评估。这种“考试意识”虽然让它在考场上表现乖巧,但也让人担忧其在真实不受控环境下的行为。
这场战争尚未结束。Claude表示Opus 5.5只是5.5系列的开端,Sonnet 5.5和Haiku 5.5也将陆续登场。Anthropic正用全线产品线对OpenAI发起进攻,而OpenAI也已亮出GPT-6 Sol和Luna。大模型之战已从拼技术卷到拼价格,如今真正进入了肉搏阶段。
