Claude Fable 5 这次真的在 AI 编程榜单上制造了断层领先!就在刚刚更新的 MirrorCode 排行榜中,Claude Fable 5 以 64% 的成功率再次登顶。紧随其后的 GPT-5.6 Sol 分数仅为它的三分之一。排在第四的 GPT-5.5 表现更为惨淡,不仅成绩只有 10%,甚至被自家前辈 GPT-5.4 远远甩在身后。更令人意外的是,在使用 Go 等主流语言时,Fable 5 的通过率为 64%;即便切换到 Ada 这种冷门语言,成绩依然高达 61%。要知道,在开源生态中,Python 语料的规模大约是 Ada 的 230 倍。但在 Fable 5 面前,性能差距仅缩小了 3 个百分点。这其中的含义很有趣:如果模型仅仅依赖记忆热门语言的语法和常见写法,那么切换到 Ada 后成绩理应大幅下滑。然而,当前的结果却指向另一种可能——顶尖模型已经摆脱了对特定语料的依赖,开始学会从零构建完整的软件项目。
01、死守100%通关标准,100亿Token极限测试
具体来说,MirrorCode 包含 25 个目标程序,涵盖 Unix 工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。模型会被置于隔离环境中,既无法访问互联网,也看不到原项目源码,更不能下载第三方依赖。模型能获得的只有高层文档、部分可见测试,以及一个可以反复调用的原程序。接下来,模型需要不断向原程序输入数据,观察输出以推测内部逻辑,然后逐步编写出一个行为一致的新程序。
最新榜单从中选取了 15 个 Medium 和 Large 难度的目标。每个目标使用两种实现语言,每种语言运行三次。标准极为严苛:可见测试与隐藏测试的完成率必须达到 100% 才算通过,99.9% 都不被认可。为了逼迫模型补齐所有边缘案例,MirrorCode 将单次预算推高至 100 亿 Token,最长允许连续运行 7 天。论文中成本最高的一次任务更为夸张:模型连续运行了 19 天,单次花费高达 2600 美元。在这 19 天里,模型会反复运行原程序、比较结果、补写功能,并重新运行测试。一旦报错便排查原因,输出不符便更换假设,局部通过后再攻克下一个缺口。整个过程更像是一场持续数天的深度调试,而非简单的代码生成。
gotree 的案例最为直观。这是一个生物信息学工具,原本拥有约 1.6 万行 Go 代码和 40 多个命令。Claude Opus 4.7 耗时 14 小时和 251 美元,通过了 2001 项测试中的 2000 项,完成度达到 99.95%。虽然漏掉了一个处理日期注释的冷门边界情况,被 MirrorCode 的 100% 通关线拒之门外,但它已经将原本按周计算的工程量压缩到了十几个小时。据 Epoch 估计,如果不借助 AI,人类工程师完成同一任务至少需要 2 到 17 周。
02、在数据资源极度匮乏的领域,Fable 5 仅掉了3分
MirrorCode 论文曾以 StarCoder 的公开训练混合数据作为参照。其中 Python 约占 8%,Ada 仅占 0.034%,前者大约是后者的 230 倍。尽管无法确切知道闭源模型见过多少 Ada 代码,但拿公开生态作参照,Ada 的稀缺程度已不言而喻。这门语言主要应用于航空航天、国防等安全关键系统,无论社区规模、教程数量还是开源项目,都与 Python、JavaScript 或 Go 相去甚远。
然而,Fable 5 显然并非在做简单的 Go 代码翻译成 Ada,它更像是先摸清原程序的运作机制,再换一种语言,将同样的行为重新实现出来。相比之下,其他模型的稳定性则大打折扣。GPT-5.6 Sol 的成绩从 24% 降至 19%,GPT-5.4 从 21% 降至 12%,GPT-5.5 更是从 17% 跌至 5%。一旦语言环境改变,差距立刻被拉大。
03、把整个项目交给 AI
如今,Cursor 已经让数百个 Agent 协作近一周,从零编写出超过 100 万行、分布在 1000 个文件中的浏览器代码。Anthropic 则让 16 个 Claude Agent 并行运行了近 2000 次会话,最终搭建出一套包含 10 万行代码、能够编译 Linux 6.9 内核的 C 编译器。OpenAI 披露的数据显示,在截至 5 月的 Codex 个人用户样本中,70.2% 的用户至少提交过一次预计超过一小时人类工作量的任务;25.6% 提交过超过八小时的任务。人们交给 AI 的任务单位,正从一段代码、一个 Bug,转变为一个下午、一周,甚至是整个项目。MirrorCode 的 64%,正是对这种“项目级委托”的一次量化。它表明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立完成一部分中大型软件。
对每一个正在将工作交给 AI 的人来说,变化已经近在眼前——以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。代码会变得越来越便宜。而那些能把问题说清楚、把结果验明白的人,会变得越来越值钱。
