Claude Fable 5 这次真的在 AI 编程榜单上制造了断层领先!就在刚刚更新的 MirrorCode 排行榜中,Claude Fable 5 以 64% 的成功率再次登顶。紧随其后的 GPT-5.6 Sol 分数仅为它的三分之一。排在第四的 GPT-5.5 表现更为惨淡,不仅成绩只有 10%,甚至被自家前辈 GPT-5.4 远远甩在身后。更令人意外的是,在使用 Go 等主流语言时,Fable 5 的通过率为 64%;即便切换到 Ada 这种冷门语言,成绩依然高达 61%。要知道,在开源生态中,Python 语料的规模大约是 Ada 的 230 倍。但在 Fable 5 面前,性能差距仅缩小了 3 个百分点。这其中的含义很有趣:如果模型仅仅依赖记忆热门语言的语法和常见写法,那么切换到 Ada 后成绩理应大幅下滑。然而,当前的结果却指向另一种可能——顶尖模型已经摆脱了对特定语料的依赖,开始学会从零构建完整的软件项目。

01、死守100%通关标准,100亿Token极限测试

具体来说,MirrorCode 包含 25 个目标程序,涵盖 Unix 工具、解释器、数据查询、生物信息学、密码学和压缩工具等领域。模型会被置于隔离环境中,既无法访问互联网,也看不到原项目源码,更不能下载第三方依赖。模型能获得的只有高层文档、部分可见测试,以及一个可以反复调用的原程序。接下来,模型需要不断向原程序输入数据,观察输出以推测内部逻辑,然后逐步编写出一个行为一致的新程序。

最新榜单从中选取了 15 个 Medium 和 Large 难度的目标。每个目标使用两种实现语言,每种语言运行三次。标准极为严苛:可见测试与隐藏测试的完成率必须达到 100% 才算通过,99.9% 都不被认可。为了逼迫模型补齐所有边缘案例,MirrorCode 将单次预算推高至 100 亿 Token,最长允许连续运行 7 天。论文中成本最高的一次任务更为夸张:模型连续运行了 19 天,单次花费高达 2600 美元。在这 19 天里,模型会反复运行原程序、比较结果、补写功能,并重新运行测试。一旦报错便排查原因,输出不符便更换假设,局部通过后再攻克下一个缺口。整个过程更像是一场持续数天的深度调试,而非简单的代码生成。

gotree 的案例最为直观。这是一个生物信息学工具,原本拥有约 1.6 万行 Go 代码和 40 多个命令。Claude Opus 4.7 耗时 14 小时和 251 美元,通过了 2001 项测试中的 2000 项,完成度达到 99.95%。虽然漏掉了一个处理日期注释的冷门边界情况,被 MirrorCode 的 100% 通关线拒之门外,但它已经将原本按周计算的工程量压缩到了十几个小时。据 Epoch 估计,如果不借助 AI,人类工程师完成同一任务至少需要 2 到 17 周。

02、在数据资源极度匮乏的领域,Fable 5 仅掉了3分

MirrorCode 论文曾以 StarCoder 的公开训练混合数据作为参照。其中 Python 约占 8%,Ada 仅占 0.034%,前者大约是后者的 230 倍。尽管无法确切知道闭源模型见过多少 Ada 代码,但拿公开生态作参照,Ada 的稀缺程度已不言而喻。这门语言主要应用于航空航天、国防等安全关键系统,无论社区规模、教程数量还是开源项目,都与 Python、JavaScript 或 Go 相去甚远。

然而,Fable 5 显然并非在做简单的 Go 代码翻译成 Ada,它更像是先摸清原程序的运作机制,再换一种语言,将同样的行为重新实现出来。相比之下,其他模型的稳定性则大打折扣。GPT-5.6 Sol 的成绩从 24% 降至 19%,GPT-5.4 从 21% 降至 12%,GPT-5.5 更是从 17% 跌至 5%。一旦语言环境改变,差距立刻被拉大。

03、把整个项目交给 AI

如今,Cursor 已经让数百个 Agent 协作近一周,从零编写出超过 100 万行、分布在 1000 个文件中的浏览器代码。Anthropic 则让 16 个 Claude Agent 并行运行了近 2000 次会话,最终搭建出一套包含 10 万行代码、能够编译 Linux 6.9 内核的 C 编译器。OpenAI 披露的数据显示,在截至 5 月的 Codex 个人用户样本中,70.2% 的用户至少提交过一次预计超过一小时人类工作量的任务;25.6% 提交过超过八小时的任务。人们交给 AI 的任务单位,正从一段代码、一个 Bug,转变为一个下午、一周,甚至是整个项目。MirrorCode 的 64%,正是对这种“项目级委托”的一次量化。它表明,只要目标足够明确,结果能够自动验收,前沿模型已经可以独立完成一部分中大型软件。

对每一个正在将工作交给 AI 的人来说,变化已经近在眼前——以前你需要盯着它写每一段代码,接下来,你更可能只在关键节点检查它有没有跑偏。代码会变得越来越便宜。而那些能把问题说清楚、把结果验明白的人,会变得越来越值钱。

最新快讯

2026年08月04日

14:35
鼓狮财经8月4日讯,据俄罗斯国防部通报,俄太平洋舰队已于当天起在日本海、鄂霍次克海及西北太平洋水域启动大规模军事演习。此次演习阵容庞大,投入兵力逾1.3万人,参演舰艇约60艘,涵盖水面舰艇、潜艇及保障船只,另有30余架飞机、直升机及无人系统协同作战。 演习旨在全面检验舰队指挥员在责任区内指挥兵力集群及执行非常规作战任务的能力,并重点演练高精度武器与新型装备的...
14:34
韩国股市近期波动加剧且呈现分化态势。周二早盘,韩国综合股价指数(KOSPI)走势如同“W”型震荡,盘中一度暴跌近3%,随后迅速拉升并转涨逾1%,重回6300点关口上方。午后指数虽有所回落,但尾盘再次发力,最终涨幅超过1%。相比之下,KOSDAQ指数表现更为强劲,受机构投资者连续净买入推动,盘中强势反弹并触发熔断机制,暂停了程序化交易。这是该指数连续第三个交易...
14:07
DeepSeek V4 Flash引发的价格风暴仍在持续。用V4 Flash开发太空射击游戏仅需7分钱,制作CS游戏也只要5毛钱。说实话,我感到有些震惊。半年前,你敢相信7分钱就能玩3D游戏,5毛钱就能玩CS吗?全球开发者已经为之疯狂。这哪里是什么AI社区,简直就是天堂。OpenCode平台的数据显示,仅在8月1日一天,DeepSeek Flash就在其平台...
14:07
7月28日,一份名为“Pacing the Frontier”的请愿书引发了全球AI行业的震动。OpenAI、Anthropic等硅谷顶尖AI企业的1346名核心员工(截至8月4日数据)联名签署,呼吁美国政府推动国际合作,研发必要的技术与治理工具,以控制自动化AI研发的节奏。在全球AI发展如火如荼的当下,这封请愿书的出现,似乎带有一种强行给狂奔的AI踩下刹车...
14:04
鼓狮财经8月4日电,高盛亚太区首席股票策略师Timothy Moe表示,该行依然看好近期遭遇重挫的韩国股市,并维持对Kospi指数12000点的目标位。Moe在接受采访时指出,若市场波动能够平息,基本面因素将重新发挥主导作用,且当前的基本面极具吸引力。他指出,目前韩国股市的市盈率仅为5倍,显著被低估,这反映出市场普遍不看好半导体存储器周期的持续性。然而,高盛...
14:03
2026年,黄金依旧是全球资本市场的核心资产。年初金价一度攀升至每盎司5405美元,随后回落至4000美元附近震荡。长期支撑因素依然存在,但高利率与强美元带来的调整压力也在,这意味着金价将进入中枢上移与波动幅度同步扩大的阶段。这种环境对黄金生产商总体利好,但并非所有企业都能同等受益。金价是外部条件,企业能否将其转化为利润,取决于实际产量、单位成本、可开采储量...
13:22
国内一家光储龙头企业派驻阿布扎比RTC项目的工程主管江聪,最近半年都在与一种“跳动的电”打交道。他负责调试的储能系统,一头连着随云层起伏的光伏发电,另一头连着周边AI算力园区里上万块GPU。如今,AI背后隐藏着庞大的电力消耗,每一次对话或生成内容,都是成千上万块GPU在运算。江聪将这种用电方式比作一辆一秒钟内从怠速猛踩油门又松开的跑车,其功率跳动以毫秒计,而...
13:22
过去两周,大模型行业的定价逻辑被两股力量同时撬动。7月17日,月之暗面发布Kimi K3。这款拥有2.8万亿参数MoE架构的模型,输出定价达到100元/百万token,较前代(K2.6/K2.7的27元)大幅上涨超3.5倍。尽管价格高昂,其定价仍不到Anthropic旗舰Fable 5的一半。发布后,外网开发者社区迅速炸开,大量对比帖与吐槽涌现,有人直言“已...
13:22
**十大「菲尔兹奖级」成果,AI证明全过程公开** OpenAI今日重磅发布了一份长达62页的「核心手稿」,详细展示了模型的完整推演过程。官方正式确认,完成这一惊人突破的正是「下一代主力模型」。若按照GPT-5.6 Sol的API计费标准计算,烧掉的所有Token成本仅为2000美元。AI证明手稿一经发布,全网再次沸腾。众人纷纷猜测,这绝大概率就是传说中的「...
13:22
8月3日,字节跳动正式拉开2027届校园招聘的序幕,面向2026年9月至2027年8月期间毕业的学生开放招聘。本次校招涵盖研发、产品、运营、设计、市场、职能支持、销售及游戏策划八大领域。 招聘策略显著向技术与产品方向倾斜,相关岗位需求占比超过七成,旨在全面加强人工智能领域的人才储备。在研发岗位方面,公司新增了“AI全栈工程师”和“AI Agent开发”等前沿...
13:18
据鼓狮财经8月4日报道,中国气象局召开新闻发布会,国家气候中心负责人指出,最新监测数据显示,2026年6月至7月期间,厄尔尼诺现象持续加剧。6月,Niño3.4区海温指数达到1.60℃,较5月上升0.64℃。从7月第二候起,该指数稳定维持在2.0℃以上。预计赤道中东太平洋海表温度将持续升高,可能在夏秋季形成一次东部型强至超强厄尔尼诺事件,且发生超强事件的概率...
13:18
机械臂炒菜、机器人调酒……2026年,人工智能正在重写中餐的“锅气”。在北京亦庄的一家餐厅里,被称为“硅基大厨”的机器人各司其职,制作汉堡、煎饼、烤串、咖啡和奶茶,样样精通。甚至乐队表演、端茶倒水、吧台调酒,也全由机器人包办。在河南郑州的街头社区小店,6台智能炒菜机一字排开,一名员工同时操作4台机器,3分钟就能出4份餐。这样的场景正在越来越多的城市上演。从走...