AI领域正经历一场震动。今早,谷歌传奇人物Jeff Dean宣布离职,结束了27年的谷歌生涯。几乎在同一时间,他与三位顶尖伙伴创立的新公司“Discovery Loop”也正式亮相。从名字可以看出,他们押注的是目前AI领域最热门的方向——RSI,即递归自我改进。目标是让AI持续迭代进化,自动攻克机器学习、科学研究和工程技术领域的重大难题。
Discovery Loop代表了一条清晰的路线:用AI加速AI。未来,AI将彻底告别单纯的“问答模式”,全面接管“提出假设、执行实验、验证结论”的科研闭环。今天,中国团队也加入了这场竞赛。
01、BigBang-V1首秀:35B参数模型力克DeepSeek V4
由上海交大人工智能学院、深势科技及上海算法创新研究院组成的“无尽前沿团队”,已经完成了这一循环。他们推出了首个通过“原生RSI”训练的基座大模型——BigBang-V1,参数量为35B。
在可验证前沿任务的牵引下,利用100%纯AI合成的数据,BigBang-V1实现了性能的爆发式增长。在35B参数级别的评测中,它一举夺得十项第一。在OpenAI提出的“FrontierScience Research”科学基准上,它获得46.2分,击败了DeepSeek V4 Pro。
35B模型硬刚1.6T参数模型,在45倍的体量悬殊下,BigBang-V1完美诠释了“以小博大”的真正含义。它在各大高难度榜单上的战绩同样硬核:
在“Humanity’s Last Exam”(人类最后考试)基准上,BigBang获得50.3分,击败V4 Pro,表现堪比Gemini 3.1 Pro。这是一个由Scale AI在《Nature》正刊上提出的测试大模型综合推理能力的基准。
在OpenAI提出的“PaperBench (Code-Dev)”上,BigBang取得53.6分,V4 Pro仅为50.4分。该基准主要考察大模型复现AI学术论文的能力。
另一个由OpenAI提出、考察模型自主完成AI工程能力的基准“MLE-Bench (Lite)”上,BigBang也交出了59.1分的亮眼答卷。
此外,在更高难度的“BioMysteryBench Human-Difficult”上,它取得15.7分,V4 Pro为13.7分。这是Anthropic迄今推出的唯一基准测试,主要考察大模型解决生物信息学研究问题的能力——即给模型一堆带噪声的测序数据,要求其分析出精确且符合评分标准的生物学结论。
技术报告中的具体案例更能看清BigBang的优势:
案例一:精准找病毒。以BioMysteryBench评测中的一道生物学题目为例——三份人体肠道类器官的测序原始数据摆在面前,模型需判断感染的是哪种RNA病毒。BigBang运行三次,答案完全一致:诺如病毒GII.4,正确率3/3。而DeepSeek V4 Flash三次则给出了三种毫不相干的病毒,无一沾边。
案例二:复现论文并纠错。这次的任务是复现论文。BigBang在阅读过程中发现异常,通过测试发现问题出在论文本身:核心设定存在矛盾。关键量被固定,导致论文声称的“子集不断缩小”无法发生。于是,BigBang直接修改了设计,使子集大小能真正变化,并修复了梯度中断问题。最终复现得分0.7657。相比之下,DeepSeek V4 Flash仅做了语法检查,代码能启动便提交,实际未运行,得分仅0.3053。
案例三:抗体设计流水线。看完单题表现,我们来个实战考验:设计一款抗体。BigBang将其拆解为流水线,串联多个开源模型。首先,用开源蛋白质设计模型生成候选,按规则筛选。然后交给AlphaFold预测抗体与靶标复合物结构,利用结构置信度和界面指标评估稳定性和合理性。不达标的淘汰或回退。过AlphaFold关后,候选还需进入开源物理打分器,评估界面能量、原子冲突等指标。关键在于,这两步使用完全独立的计算方法,结论一致才保留。这些仅为计算候选,最终需实验验证,设计出的样例分子……
一个仅有35B参数的模型为何拥有如此强悍的战斗力?答案藏在“原生RSI”训练方式中。令人震撼的是,BigBang使用的各学科前沿科研数据,100%由AI合成。题目由AI出,解法由AI跑,答案由AI验,甚至连“如何造数据”也是AI自己完成的。这才是BigBang真正想引爆的核心。
02、一个RSI闭环,跑通了
具体来说,BigBang构建了一条能持续修改自身生产策略的合成数据流水线。AlphaGo学人类棋谱,AlphaZero扔掉棋谱自己跟自己下。BigBang的数据引擎思路相同,但赛道不同——这一次,自我博弈的内容不是下棋,而是出题和判卷。
该引擎由两类Agent组成,外层套着一层真实考试。Generator Agent负责出题及改造出题方法。它直接修改、运行和调试数据合成程序,根据模型当前能力缺口调整任务与验证规则:题目应来自哪些科学领域、需要多长的推理链、该用搜索、计算、代码还是模拟工具、最终答案如何验证、哪些样本留下淘汰、哪些生成策略已证明失败不再尝试。每轮结束后,它会记录改动原因、结果及失败点,下一轮探索踩在上一轮经验上。
Critic Agent负责审题,主要站在对面“挑刺”。审查分两层:第一层看格式、工具执行、数据完整性等硬伤;第二层才进正题——题目对不对、能否验证、够不够难、是否与已有重复、最关键的是训练是否有效。不合格的打回重做,通过的进合成数据集。
然而若仅此而已,只会得到一个转得很快的内循环,且存在致命隐患:出题方会讨好判卷方。有些题看似复杂实则堆砌表面难度;有些样本Critic高分但模型未提升;甚至有些题会钻验证器漏洞骗取虚假正反馈。对此,BigBang的解法是在外层再套一层:用真实训练结果考核Critic。若Critic高分但模型未长本事,说明判偏,系统用真实结果校准它,再调整Generator下一轮选题和难度。
于是,整套系统闭环合成,飞轮转动:真实任务暴露缺口 → 造题筛题 → 合成数据训练新模型 → 回到真实任务受检 → 用结果校准下一轮。团队将其命名为数据层的递归自我改进(RSI)。
为什么是科学?科学是人类系统认识宇宙世界的基本方式,本身就是无尽前沿。因此,它成了通用智能最好的训练场——既难又普适。具体到BigBang,选科学当练兵场,是看中它同时具备“让模型持续变强”的两个关键条件:前沿性和可验证性。
前沿,指题目够难,位于知识和能力边界,有的压根没有已知最优解。不像静态题库刷完就没,新理论、新工具不断涌现,前沿会源源不断生成新题。可验证,指答案能被客观检查,形式化方法、代码执行、数值计算、仿真器、实验反馈、领域工具均可。更难得的是,科学天生融合了搜索、阅读、提假设、数学推导、写代码、调工具。在队伍眼里,科学早已超出“一个知识领域”,是通往通用智能的综合课;只要科学前沿延伸,模型可学之物无尽,智能向上空间无限。
03、AI迭代AI,奇点已现
BigBang-V1的诞生证明了Scaling的破局点不仅在于参数与算力堆叠。无需扩大基础模型参数量,仅通过革新训练任务生成范式,它便在科学研究、长程探索、代码生成、工具调用上获得全面性能增益。
更重要的是,AI每轮能力提升都在为下一轮制造新燃料。AI生成并求解科学任务,科学任务训练出更强AI,更强AI再回到下一轮改进数据系统。“无尽前沿”团队将此循环凝练为一句话:AI推进科学,科学推进AI。
这支由上海交大人工智能学院首席顾问鄂维南院士、副教授陈思衡、助理教授张林峰、深势科技创始人张林峰等大咖领衔的明星团队,野心不止于此。箴言背后,他们指向更遥远的星辰大海。
他们试图打造一个在智能与理性判断上逐步逼近“造物主”的终极模型。它能冷静客观地洞悉万事万物的机缘、机理、规律与发展变化,严格按事物规律去回答、执行、判断和预测。这也解释了为何这条路必须建在“科学”上。因此,追寻AGI与追寻科学本质是同一件事:向造物主致敬。无限逼近造物主的意义,说到底就是无限优化。
1945年,范内瓦·布什在《科学:无尽的前沿》中回答了一个国家如何靠持续投入基础科学换来几十年的增长。81年后,这支以“无尽前沿”为名的中国团队将命题延展至AI时代——当科学前沿本身化作模型无尽开采的训练富矿,人类逐题生产训练数据的时代是否正在结束?
BigBang-V1大概只是这条新曲线上的第一个点,但这条曲线已经开始爬坡了。
