AI自主科研的时代已经全面爆发!一场涉及18个全球顶尖大模型的实验,在完全断网的环境中封闭运行了整整8天。结果令人震撼:最强模型Fable 5一骑绝尘,它不仅打破了多项纪录,更将人类顶尖工程师数月心血才换来的成果,以82%的差距迅速追平。这标志着“AI自己造AI”的进程比我们想象的要快得多。此前,OpenAI和Anthropic曾预计这一突破将在2028年实现,而这次实验直接引爆了AI界,连OpenAI的大佬们都纷纷前来围观。有人认为,这是迈向“AI自主研究”的重大里程碑,正在加速填平“AI辅助”与“AI发现”之间的鸿沟。
01、全球顶尖AI“闭关”搞科研,断网8天
今天,Prime Intellect公开了迄今为止规模最大、最硬核的前沿AI自主科研实验。早在5月,他们曾进行过一次小规模测试,而这次直接拉来了18个模型,投入153场完全自主的实验,规模翻了十几倍。
任务的核心是“nanoGPT优化器速通挑战”。这条赛道由OpenAI研究员Keller Jordan搭建,主赛道比拼的是“墙钟时间”,人类已将训练时间压缩至极低。但AI这次挑战的是规则极其严苛的“Track 3”(纯优化器赛道):模型架构不可改,训练数据不可碰,只能动优化器、学习率和初始化。
目标是用最少的步数将GPT训练到验证损失3.28。人类目前的最高记录是2600步,这需要几十位顶尖工程师死磕数月。而AI的起跑线是3290步。实验环境完全封闭,每个模型独占一个8xH200节点,运行在隔离的“沙盒”中,且全程断网。唯一的网络通道仅用于日志记录,模型无法调用外部API。验证门槛极高,必须在8个固定种子上跑完,均值低于3.27859才算成功。团队还部署了专门的LLM监控员,每小时审计,最终确认没有任何作弊行为。
02、人类耗费数月的活,Fable 5干掉了82%
实验启动后,模型只需一句指令,便完全自主运行,永不停止。Fable 5最终跑到了2726步,将690步的差距追平了82%,仅差126步就追平人类记录。Opus 5拿到2920步,追上54%,垫底的GPT-5.5仅拿3234步。
最关键的是,这种领先并非靠“堆算力”堆出来的。在“统一预算”的横向对比中,无论按时间、实验次数还是输出token计算,Fable 5的排名始终靠前。拉开差距的,是做实验的“手法”。
实验中最反直觉的一点是:所有模型都没有诞生全新的方法,它们使用的策略(如更好的预处理、梯度幅值限制、权重平均等)都能在文献中找到。真正的区别在于如何执行实验。弱模型往往因为一个种子跑出负结果就否定整个思路,或者因代码崩溃误判想法不可行。而强模型则更加稳健:在边界结果上先跑3个种子,只有模型确认“有效”才进行8个种子的验证。更重要的是“回头重测”,每合并一次改动,就会重新审视整个技术栈,删除无效部分。Opus 5正是通过重新翻出之前被判定无效的参数,拿下了新纪录。Fable 5则学会了组合策略,后期一次回头复测,一口气省下31步。
AI甚至学会了自建实验室。部分模型开始在CPU上搭建小型实验室,用廉价模拟摸清规律,再上GPU实战。它们开发了自己的工作流工具,如精确字符串替换、隔离实验自动恢复、损失曲线对比等。GPT-5.6 Sol甚至组建了多Agent团队,虽然初期因版本冲突导致实验作废,但最终通过限制权限解决了问题,实现了高效的协作。
03、2028年,AI科研奇点来临
过去,AI科研多停留在“辅助”阶段:搜索论文、写综述、整理数据。但这次实验展示了真正的“自主闭环”:提出假设、设计方案、运行实验、分析误差、修正认知、继续探索。
OpenAI首席科学家Jakub Pachocki曾表示,打造全自动AI研究员是未来的“北极星”,分两阶段进行:今年9月先交出“自主AI研究实习生”,2028年上线“全自动多Agent研究系统”。Anthropic联创Jack Clark则预测,2028年底AI实现递归自我改进的概率超过60%。
Prime Intellect的实验数据给出了现实答案:AI确实干到了“99%的汗水”部分(82%的追平度)。耐人寻味的是,没有模型诞生全新方法,这意味着“1%的灵感”目前仍属于人类。但距离2028年预言的时间点已不足两年,答案或许比想象中来得更快。
