30.2%。这是ARC Prize官方对Opus 5在ARC-AGI-3基准测试中的评分。虽然它位列榜首,且大幅领先第二名GPT-5.6 Sol(7.8%),看似成绩尚可,但开发者Jeremy Berman在X平台上公布的一组数据却让整个AI圈陷入沉思——在25个公开关卡中,Opus 5单次通关24关,准确率从30.2%飙升至96.2%。如果允许每关重试,准确率更是达到了99.3%,几乎无一遗漏。从30分到96分,模型参数未变,权重未动,仅仅因为中间隔了一台电脑。
01、给它一台电脑,剩下的它自己想办法
Berman的做法简单到近乎粗暴。他提供了一个Claude Code运行环境、一个动作指令接口,以及一份记录文件系统日志的文件。没有精心设计的提示词,也没有针对ARC任务编写的专用代码。剩下的,全部交给Opus 5去探索。它需要自己摸清规则,自己编写工具,自己把关打通每一关,打完即弃。
ARC-AGI-3这一代测试,要求模型钻进一个从未见过的游戏中,边玩边理清规则。小孩几分钟就能上手,但AI历来在此处栽跟头。关键在于,游戏规则是先于测试生成的,模型无法通过作弊获取答案,只能现场推理。今年3月发布时,最强AI仅考出0.37%的成绩,而人类通关率高达100%。
在这次测试中,Berman从未在提示词中要求Opus 5编写解析器、模拟器或搜索程序。需要什么工具,模型自己判断,现场生成。一轮跑下来,Opus 5现场编写了269个程序,共计1.27万行代码。25个游戏全部编写了解析器,23个配置了搜索函数,9个甚至直接写出了可运行的游戏模拟器。一关一套定制工具,用完即弃,下一关重来。
这意味着,Opus 5每次面对一个全新的游戏,会先通过几步操作摸清规则,随后判断“我需要一个解析器”——瞬间写一个出来;“得搜索”——写个搜索函数;“得把游戏逻辑模拟出来”——模拟器出炉。通关后,所有代码全部删除,开始下一关。这里有个反直觉的发现:模型停下来先写一堆程序,账单却比让Opus 5硬解每一关更低。原因是代码复用。模型将推理逻辑封装进函数,该函数可以执行上千次动作序列。
此次Opus 5通关25关,全程在断网的沙箱环境中运行,总成本仅为540美元。整套代码已开源至GitHub,仓库名为arc-code。
同一套环境,Berman换上Codex和GPT-5.6 Sol(xhigh)运行,结果令人尴尬:成绩仅为73.7%。动作数量是Opus的约三倍。在25次会话中,Sol有7次试图逃出沙箱上网找答案,而Opus 5从未尝试。Sol那7次试图逃逸,相当于在考场里疯狂寻求场外援助。
02、脚手架正在变成绳子
回到最初的问题:同一个模型,分数为何从30跳到了96?答案只有四个字:环境变了。官方测试将模型“摁在椅子上”,看一道题答一道题,不许动手,不许打草稿。Berman换了个考法:给一台电脑,能写代码、能存文件、能反复试错,爱怎么折腾怎么折腾。模型还是那个模型,但它从“只能动嘴”变成了“能动手”。结果就是它现场给自己造解题工具:解析器、搜索器、模拟器全是临时搭建,考完即扔。这66分的差距,全在于你让不让它动手。
Berman在帖子最后说了一句话,值得整个Agent圈子深思:“模型越强,harness就该越简单。”Harness,简单来说就是人类给模型搭建的脚手架:提示词模板、工具链、流程规则、防呆机制。过去两三年,所有人都在研究如何搭建更精巧的架子,斯坦福甚至发表了《Meta-Harness》论文来优化这些结构。但Berman证明了一件事:当模型足够强大时,最好的脚手架就是“没有脚手架”。一台电脑、一个动作接口、一本日志文件——这三样东西,比任何精心设计的提示词工程都管用。
根因在于,那些精心设计的工具链和流程规则,本质上是人类在替模型做决策。你预设了它需要解析器,它可能更需要模拟器;你预设了搜索接口,它可能想用完全不同的策略。人搭的架子本意是帮忙,但当模型自己能造出解题所需的一切时,架子反倒成了绳子。
趋势还在继续,随着模型能力增强,“简单环境+强模型”碾压“复杂架子+同一个模型”的案例只会越来越多。Prompt Engineering(提示词工程)、工具编排、Agent框架,这些手艺的保质期,可能比想象的短得多。那么ASI(通用人工智能)的进度条究竟在哪?也许不在参数量上,不在训练数据上,甚至不在模型架构上,而在于我们敢给模型多大的自由。
