30.2%。这是ARC Prize官方对Opus 5在ARC-AGI-3基准测试中的评分。虽然它位列榜首,且大幅领先第二名GPT-5.6 Sol(7.8%),看似成绩尚可,但开发者Jeremy Berman在X平台上公布的一组数据却让整个AI圈陷入沉思——在25个公开关卡中,Opus 5单次通关24关,准确率从30.2%飙升至96.2%。如果允许每关重试,准确率更是达到了99.3%,几乎无一遗漏。从30分到96分,模型参数未变,权重未动,仅仅因为中间隔了一台电脑。

01、给它一台电脑,剩下的它自己想办法

Berman的做法简单到近乎粗暴。他提供了一个Claude Code运行环境、一个动作指令接口,以及一份记录文件系统日志的文件。没有精心设计的提示词,也没有针对ARC任务编写的专用代码。剩下的,全部交给Opus 5去探索。它需要自己摸清规则,自己编写工具,自己把关打通每一关,打完即弃。

ARC-AGI-3这一代测试,要求模型钻进一个从未见过的游戏中,边玩边理清规则。小孩几分钟就能上手,但AI历来在此处栽跟头。关键在于,游戏规则是先于测试生成的,模型无法通过作弊获取答案,只能现场推理。今年3月发布时,最强AI仅考出0.37%的成绩,而人类通关率高达100%。

在这次测试中,Berman从未在提示词中要求Opus 5编写解析器、模拟器或搜索程序。需要什么工具,模型自己判断,现场生成。一轮跑下来,Opus 5现场编写了269个程序,共计1.27万行代码。25个游戏全部编写了解析器,23个配置了搜索函数,9个甚至直接写出了可运行的游戏模拟器。一关一套定制工具,用完即弃,下一关重来。

这意味着,Opus 5每次面对一个全新的游戏,会先通过几步操作摸清规则,随后判断“我需要一个解析器”——瞬间写一个出来;“得搜索”——写个搜索函数;“得把游戏逻辑模拟出来”——模拟器出炉。通关后,所有代码全部删除,开始下一关。这里有个反直觉的发现:模型停下来先写一堆程序,账单却比让Opus 5硬解每一关更低。原因是代码复用。模型将推理逻辑封装进函数,该函数可以执行上千次动作序列。

此次Opus 5通关25关,全程在断网的沙箱环境中运行,总成本仅为540美元。整套代码已开源至GitHub,仓库名为arc-code。

同一套环境,Berman换上Codex和GPT-5.6 Sol(xhigh)运行,结果令人尴尬:成绩仅为73.7%。动作数量是Opus的约三倍。在25次会话中,Sol有7次试图逃出沙箱上网找答案,而Opus 5从未尝试。Sol那7次试图逃逸,相当于在考场里疯狂寻求场外援助。

02、脚手架正在变成绳子

回到最初的问题:同一个模型,分数为何从30跳到了96?答案只有四个字:环境变了。官方测试将模型“摁在椅子上”,看一道题答一道题,不许动手,不许打草稿。Berman换了个考法:给一台电脑,能写代码、能存文件、能反复试错,爱怎么折腾怎么折腾。模型还是那个模型,但它从“只能动嘴”变成了“能动手”。结果就是它现场给自己造解题工具:解析器、搜索器、模拟器全是临时搭建,考完即扔。这66分的差距,全在于你让不让它动手。

Berman在帖子最后说了一句话,值得整个Agent圈子深思:“模型越强,harness就该越简单。”Harness,简单来说就是人类给模型搭建的脚手架:提示词模板、工具链、流程规则、防呆机制。过去两三年,所有人都在研究如何搭建更精巧的架子,斯坦福甚至发表了《Meta-Harness》论文来优化这些结构。但Berman证明了一件事:当模型足够强大时,最好的脚手架就是“没有脚手架”。一台电脑、一个动作接口、一本日志文件——这三样东西,比任何精心设计的提示词工程都管用。

根因在于,那些精心设计的工具链和流程规则,本质上是人类在替模型做决策。你预设了它需要解析器,它可能更需要模拟器;你预设了搜索接口,它可能想用完全不同的策略。人搭的架子本意是帮忙,但当模型自己能造出解题所需的一切时,架子反倒成了绳子。

趋势还在继续,随着模型能力增强,“简单环境+强模型”碾压“复杂架子+同一个模型”的案例只会越来越多。Prompt Engineering(提示词工程)、工具编排、Agent框架,这些手艺的保质期,可能比想象的短得多。那么ASI(通用人工智能)的进度条究竟在哪?也许不在参数量上,不在训练数据上,甚至不在模型架构上,而在于我们敢给模型多大的自由。

最新快讯

2026年08月13日

17:28
据鼓狮财经8月13日报道,俄罗斯副外长里亚布科夫当地时间8月13日表示,俄方尚未获悉乌克兰总统泽连斯基提出的结束俄乌冲突的方案。 关于美国总统特使威特科夫及特朗普女婿库什纳计划访俄的消息,里亚布科夫称俄方正在密切留意。他强调,一旦美方代表团的行程安排敲定,俄方将迅速落实接待工作。
17:28
8月13日,华虹宏力公布了2026年第二季度的财报,多项关键指标表现优异。当季,公司实现销售收入7.175亿美元,不仅刷新了历史纪录,还同比增长了26.8%,超过了市场预期的7.027亿美元。 在利润与毛利率方面,公司当季毛利率为16.5%,较去年同期提升5.6个百分点,环比亦有所增长,优于预期的14.9%。母公司拥有人应占利润为3860万美元,同比及环比均...
17:28
2026年被视为AI智能体元年,行业在这一年集体转向主动智能、具身终端与人机伙伴生态。而荣耀的战略布局,早于行业共识的形成。2025年3月,荣耀在MWC上发布Alpha战略,宣布用五年时间、投入超100亿美元,从手机厂商转型为AI终端生态公司。这一时间点领先于大部分友商公开明确AI终端战略。更重要的是,战略发布之前,荣耀内部已在进行技术储备和方向预研。一年半...
17:28
8月13日,中芯国际正式公布了2026年第二季度财报,业绩表现十分亮眼。当季公司实现营收30.056亿美元,同比增长36.1%,环比增长20%,成功超出市场此前预期的28.66亿美元。净利润录得4.79亿美元,同比大幅增长261.7%,远超市场预期的2.51亿美元。毛利率则达到25.3%,较上一季度提升5.2个百分点。 对于即将到来的第三季度,公司预计营收将...
17:28
全球外汇市场中,日元无疑是最牵动神经的焦点。周四午后,日元突然短线急涨,随后进入震荡整理。据市场消息,日本政府正支持日央行近期加息,旨在缓解日元持续疲软带来的通胀压力。目前,日元汇率重回159区间震荡,此前美日联合干预的成效正在快速消退。截至发稿,美元兑日元下挫超30点,报159.399。 关于日本政府是否支持加息,据彭博报道,日本政府已释放出支持近期加息的...
17:28
8月13日,港股三大指数午后开盘直线冲高,得益于联想集团发布业绩后大涨,强力带动恒生科技指数一度涨至1.3%,最终收涨0.33%,恒生指数、国企指数分别下跌0.17%及0.23%,录得3连跌行情。盘面上,大型科网股普遍下跌,资本开支大增引发忧虑,腾讯大跌4.46%表现较差,小米跌1.8%;受外围芯片股强势带动,存储半导体、光通信概念股、PCB概念股全天表现活...
16:57
8月13日,鼓狮财经报道花园生物(300401.SZ)发布公告,宣布公司已成功取得浙江省药品监督管理局核发的《药品生产许可证》,有效期至2031年8月9日。作为公司首次获得此类资质,此次取证标志着公司顺利通过药品GMP符合性检查,为原料药及制剂产品的上市许可、商业化生产销售奠定了坚实基础,有助于进一步优化维生素D3全产业链布局。公司同时提示,产品仍需取得原料...
16:57
8月13日,华森制药(002907.SZ)发布公告称,其控股子公司成都华森奥睿药业近日正式获批磷酸ORIC-1327滴眼液《药物临床试验批准通知书》。该药品属于1.1类新药,主要针对青光眼和高眼压症进行治疗。作为华森奥睿自主研发的选择性小分子抑制剂,该药物在临床前研究中表现出显著的降眼压效果以及良好的眼部安全性。截至目前,公司子公司已累计获得三个1.1类新药...
16:31
前OpenAI首席科学家Ilya,大概就是「哥已不在江湖,但江湖却到处都是哥的传说」的典型代表。亲手缔造深度学习时代的他,离开OpenAI已两年有余。自己创办的SSI不发模型,不做产品,几乎从牌桌上消失。可AI圈每隔一段时间,还是会有人追问同一个问题:Ilya在干嘛?现在,这件问题突然有了一个答案。就在刚刚,X上网友「三只草莓」爆料,SSI...