Claude 这次的表现确实令人惊叹,直接在编程榜单上制造了断层。在最新刷新的 MirrorCode 排行榜上,Claude Fable 5 以 64% 的绝对成功率稳居榜首。紧随其后的 GPT-5.6 Sol 分数仅为前者的三分之一。

排在第四的 GPT-5.5 情况则更为严峻,不仅成绩仅剩 10%,甚至被自家前辈 GPT-5.4 超越。更有趣的是,Fable 5 在使用 Go 等主流语言时准确率为 64%,即便切换到冷门的 Ada 语言,成绩依然高达 61%。众所周知,在开源生态中,Python 的语料量大约是 Ada 的 230 倍。然而在 Fable 5 身上,性能仅下降了 3 个百分点。这不禁让人深思:如果模型仅依赖记忆热门语言的语法和写法,切换语言后成绩理应大幅下滑。但目前的测试结果暗示了另一种可能性——最强的模型已经摆脱了特定语料的限制,开始掌握从零构建完整软件项目的能力。

**卡死在 100% 通关线,100 亿 Token 极限测试**

MirrorCode 的测试环境极具挑战性。整套测试包含 25 个目标程序,涵盖 Unix 工具、解释器、数据查询、生物信息学、密码学和压缩工具等多个领域。模型被置于隔离环境中,无法访问互联网,看不到原项目源码,也不能下载第三方依赖。它仅能获取高层文档、部分可见测试用例以及一个可反复调用的原程序。模型需要通过不断向原程序输入数据、观察输出来推测内部逻辑,并逐步编写出一个行为一致的新程序。

最新榜单从测试集中筛选出 15 个 Medium 和 Large 难度的目标,每个目标要求使用两种编程语言实现,每种语言运行三次。更严格的是,可见测试与隐藏测试的完成率必须达到 100% 才算通过,99.9% 都不被接受。只要漏掉一个边缘案例,整次运行即判定为失败。为了逼迫模型填补最后的技术漏洞,MirrorCode 将单次运行预算提升至 100 亿 Token,最长允许连续运行 7 天。

论文中记录的成本最高的一次任务更是惊人:模型连续运行了 19 天,单次花费高达 2600 美元。在这 19 天里,模型反复运行原程序、比对结果、补写功能并重新运行测试。报错便查原因,输出不符便更换假设,局部通过后继续追查下一个缺口。整个过程更像是持续数天的深度调试,而非一次性生成。

**gotree** 的例子最为直观。这是一个拥有约 1.6 万行 Go 代码和 40 多个命令的生物信息学工具。Claude Opus 4.7 耗时 14 小时、花费 251 美元,通过了 2001 项测试中的 2000 项,完成度达到 99.95%。虽然因漏掉一个处理日期注释的冷门边界被 MirrorCode 的 100% 通关线拒之门外,但它已将原本需要数周的人工工程量压缩在十几个小时之内。据 Epoch 估算,如果不借助 AI,人类工程师完成同一任务至少需要 2 到 17 周。

**语料荒漠里,Fable 5 仅掉了 3 分**

MirrorCode 论文曾以 StarCoder 的公开训练混合数据作为参照。其中 Python 约占 8%,Ada 仅占 0.034%,前者约为后者的 230 倍。虽然我们无法确切知道闭源模型见过多少 Ada 代码,但以公开生态为参照,Ada 的稀缺程度已不言而喻。这门语言主要用于航空航天、国防等安全关键领域,无论是社区规模、教程数量还是开源项目,都无法与 Python、JavaScript 或 Go 相提并论。

然而,Fable 5 显然不是在将 Go 代码逐句翻译成 Ada,而是先摸清原程序的工作原理,再换一门语言将其行为重新构建出来。相比之下,其他模型的表现则大相径庭。GPT-5.6 Sol 从 24% 降至 19%,GPT-5.4 从 21% 降至 12%,GPT-5.5 更是从 17% 骤降至 5%。语言一旦切换,差距立刻被放大。

**把整个项目交给 AI**

如今,Cursor 已让数百个 AI Agent 协作近一周,从零编写出超过 100 万行、分布在 1000 个文件中的浏览器代码。Anthropic 则让 16 个 Claude Agent 并行运行近 2000 次会话,最终构建出一套包含 10 万行代码、能够编译 Linux 6.9 内核的 C 编译器。OpenAI 公布的数据显示,截至 5 月,Codex 个人用户样本中,70.2% 至少提交过一次预计超过一小时人类工作量的任务;25.6% 提交过超过八小时的任务。人们交给 AI 的计算单位,正从一段代码、一个 Bug,演变为一个下午、一周,甚至整个项目。

MirrorCode 64% 的成绩,正是对这种“项目级委托”的一次量化。这表明,只要目标足够明确、结果能够自动验收,前沿模型已经能够独立完成一部分中大型软件的开发。对于每一个正在将工作交给 AI 的人来说,这种变化已经近在眼前——以前你需要盯着它编写每一段代码,未来你更可能只在关键节点检查它是否跑偏。代码将变得越来越廉价,而那些能把问题说清楚、把结果验明白的人,将变得越来越值钱。

最新快讯

2026年08月04日

18:03
AI奇点已近在咫尺。最近,被誉为“硅谷巴菲特”的投资人Chamath Palihapitiya在社交平台上抛出了关于AI奇点的终极路线图。他预言,人类将首先构建出通用人工智能,随后AGI将变得极其擅长AI研究,设计出更聪明的AI,后者再设计出更强的AI,如此循环往复,且速度越来越快。紧接着,他得出一个惊人的结论:纵观过去几周各大AI实验室的成果,我们其实已经...
18:03
鼓狮财经8月4日报道,9月9日至11日,国际集成电路创新博览会(IICIE)将在深圳拉开帷幕。本届展会将全方位展示芯片设计、晶圆制造、封装测试、核心设备、关键材料及核心零部件等半导体全产业链。展会同期还将举办20余场高规格峰会与专业论坛,议题紧密围绕汽车电子、消费电子、RISC-V、EDA与IP、人工智能、存储、安防监控及工业控制等核心热点。 当前,国内半导...
18:02
今年各类资产经历了前所未有的剧烈震荡。年初,黄金ETF单月涨幅超20%,白银涨幅高达60%,创下近40年最佳表现。然而,白银随后从高点暴跌36%,创下有记录以来最大单日跌幅,令投资者措手不及。科技股的走势亦如出一辙,上半年领涨全球,但7月画风急转,费城半导体指数暴跌超20%,韩股、台股及中概科技股均遭遇重创,市场迅速从“紧缺”转为“过剩”的恐慌。 究其原因,...
18:02
今日,你站在光里了吗?隔夜美股科技股强势大涨,英伟达涨近3%,总市值重回5万亿美元上方;谷歌涨近5%,总市值超越苹果,跃居全球第二;亚马逊涨4.58%,市值首次突破3万亿美元大关。A股同样迎来“相信光”的时刻——7月录得史诗级跌幅的双创指数率先反攻,创业板指大涨逾5%,科创50涨4%紧随其后。“CPO三雄”中际旭创、新易盛和天孚通信携手大涨,“CPO含量高”...
18:02
A股三大指数今日集体上涨,截至收盘,上证指数涨0.33%,深证成指涨3.25%,创业板指涨5.64%,北证50涨1.62%,科创50指数涨4.09%。全市场成交额22284亿元,较上日放量2174亿元,全市场超3600只个股上涨。算力硬件产业链大幅反弹,CPO、PCB、存储器方向领涨;CRO、工业金属、半导体设备、算力租赁、多模态AI、人形机器人题材活跃。银...
18:02
当前全球资本市场局势动荡,韩国致力于稳定汇率,美国则试图稳固债务,几条战线相互交织,最终汇聚于美日联合干预外汇市场这一焦点。近日,日本财务省与美国财政部协调行动,旨在遏制日元过度贬值,这是双方时隔15年再次联手干预汇市。此前,美元兑日元一度逼近164点,而在干预后,汇率迅速回落至156点附近。 美国此次出手救日元,本质上是一种金融自保行为。其核心担忧在于,若...
17:29
当你在千问App里输入“我是个新手孕妈,应该买些什么”,AI几秒内便会列出一份详尽的待产清单;当你向豆包对话框输入“4000元以内的手机”,AI能直接帮你比价、计算优惠;当你打开淘宝,AI导购迅速上线……不知不觉间,AI助手已成为各大综合电商及本地生活平台的标配。购物这件事,正悄然从“搜索框”演变为“对话框”。2026年以来,主流电商平台集体押注AI对话购物...
17:23
据鼓狮财经8月4日报道,多家半导体厂商正陆续恢复在熊本地区的生产运营。瑞萨电子熊本川尻工厂已提前启动分阶段复工,并计划在复工后约三周内恢复至震前产能。索尼半导体解决方案公司此前宣布,受7月28日熊本地震影响的熊本技术中心已完成安全检查与修复,定于8月4日起分阶段恢复运营,预计8月中旬全面恢复震前产能。台积电熊本第一工厂在确认建筑安全并完成设备调整后,目前已恢...
17:22
SK海力士此前承诺将年度营业利润的10%作为奖金发放,此举曾引发半导体行业的集体涨薪热潮。然而,最新消息显示,SK海力士与工会就奖金的具体执行方案陷入了僵局。 受益于人工智能领域的巨额投资热潮,SK海力士今年有望创下盈利纪录。据分析师预测,公司今年的营业利润预计可达1750亿美元,以此计算,员工人均奖金可能高达约49万美元。 代表员工的工会指出,管理层倾向于...
17:22
鼓狮财经8月4日讯,日本投资控股巨头软银集团将于本周四盘后发布2027财年第一财季财报。市场焦点主要集中在软银不断攀升的杠杆率对其资产负债表的冲击,以及其能否持续为OpenAI输血。 虽然软银在截至2026年3月的财年录得创纪录的净利润,但自6月初以来,其股价已腰斩。与此同时,用于对冲债务违约风险的信用违约互换(CDS)利差显著攀升,反映出市场对其偿债能力的...