经过漫长的等待,Claude Opus 5 于周六凌晨正式发布。目前该模型已全量上线,覆盖所有 Claude 产品。其拥有 100 万上下文窗口,知识截止至 2026 年 5 月,实力强劲。
原本在 Codex 上挂了几个任务准备早睡,但得知消息后我立即取消了所有任务,改用 Opus 5 重新运行。此外,之前因 Fable 5 额度用光而搁置的任务,我也准备用 Opus 5 重跑一遍。为了让大家直观感受其强大性能,我整理了跑分数据。客观来说,Anthropic 虽然常被诟病,但技术实力确实过硬。在 ARC-AGI-3 测试中,Opus 5 达到了 30.2%,而 GPT-5.6 Sol 只有 7.8%,Opus 4.8 仅 1.5%。在 AA 测试中,Opus 5 甚至超过了 Fable 5。价格方面,输入每百万 Token 5 美元,输出 25 美元,与 Opus 4.8 相同,还提供了速度提升 2.5 倍的 Fast Mode。
Opus 5 的定位非常清晰:它更像一个成熟的执行型 Agent,擅长工具调用、结果检查和纠错;而 Fable 5 则是一颗更大的纯大脑,擅长原生推理、专业医疗表达及高难度编程。在工程和 Agent 任务上 Opus 5 更优,但在方案设计上 Fable 5 依然最好。两者并非替代关系,而是互补。
我最近重构了 AIHOT 平台的 API、RSS 和 Skill。因 Fable 5 额度耗尽,我借用了 GPT-5.6 Sol 进行深度 Review。尽管多方报告称方案可行,但 Opus 5 运行时却发现了严重的缓存击穿漏洞,让我不得不紧急修复。这次经历也让我意识到,模型越聪明,越需要警惕边缘情况。在 UI 设计上,Opus 5 配合 Claude Design,细节提升明显。写作能力上,Opus 4.6 仍保持领先。
随着模型进步,繁琐的规则和 Skill 逐渐失效。Anthropic 删除了 Claude Code 80% 以上的 System Prompt,提出了从“手册制”到“Harness 设计”的转变,即构建工作环境而非灌输规则。最后分享我的模型使用策略:Fable 5 用于规划与底层研究;Opus 5 用于方案设计、代码执行与 BUG 修复;GPT-5.6 Sol 用于大型代码 Review;Kimi K3 用于前端展示。模型迭代速度极快,仿佛迈过了奇点,这种日新月异的变化让人感到无比幸福。
