AI领域正经历一场震动。今早,谷歌传奇人物Jeff Dean宣布离职,结束了27年的谷歌生涯。几乎在同一时间,他与三位顶尖伙伴创立的新公司“Discovery Loop”也正式亮相。从名字可以看出,他们押注的是目前AI领域最热门的方向——RSI,即递归自我改进。目标是让AI持续迭代进化,自动攻克机器学习、科学研究和工程技术领域的重大难题。

Discovery Loop代表了一条清晰的路线:用AI加速AI。未来,AI将彻底告别单纯的“问答模式”,全面接管“提出假设、执行实验、验证结论”的科研闭环。今天,中国团队也加入了这场竞赛。

01、BigBang-V1首秀:35B参数模型力克DeepSeek V4

由上海交大人工智能学院、深势科技及上海算法创新研究院组成的“无尽前沿团队”,已经完成了这一循环。他们推出了首个通过“原生RSI”训练的基座大模型——BigBang-V1,参数量为35B。

在可验证前沿任务的牵引下,利用100%纯AI合成的数据,BigBang-V1实现了性能的爆发式增长。在35B参数级别的评测中,它一举夺得十项第一。在OpenAI提出的“FrontierScience Research”科学基准上,它获得46.2分,击败了DeepSeek V4 Pro。

35B模型硬刚1.6T参数模型,在45倍的体量悬殊下,BigBang-V1完美诠释了“以小博大”的真正含义。它在各大高难度榜单上的战绩同样硬核:

在“Humanity’s Last Exam”(人类最后考试)基准上,BigBang获得50.3分,击败V4 Pro,表现堪比Gemini 3.1 Pro。这是一个由Scale AI在《Nature》正刊上提出的测试大模型综合推理能力的基准。

在OpenAI提出的“PaperBench (Code-Dev)”上,BigBang取得53.6分,V4 Pro仅为50.4分。该基准主要考察大模型复现AI学术论文的能力。

另一个由OpenAI提出、考察模型自主完成AI工程能力的基准“MLE-Bench (Lite)”上,BigBang也交出了59.1分的亮眼答卷。

此外,在更高难度的“BioMysteryBench Human-Difficult”上,它取得15.7分,V4 Pro为13.7分。这是Anthropic迄今推出的唯一基准测试,主要考察大模型解决生物信息学研究问题的能力——即给模型一堆带噪声的测序数据,要求其分析出精确且符合评分标准的生物学结论。

技术报告中的具体案例更能看清BigBang的优势:

案例一:精准找病毒。以BioMysteryBench评测中的一道生物学题目为例——三份人体肠道类器官的测序原始数据摆在面前,模型需判断感染的是哪种RNA病毒。BigBang运行三次,答案完全一致:诺如病毒GII.4,正确率3/3。而DeepSeek V4 Flash三次则给出了三种毫不相干的病毒,无一沾边。

案例二:复现论文并纠错。这次的任务是复现论文。BigBang在阅读过程中发现异常,通过测试发现问题出在论文本身:核心设定存在矛盾。关键量被固定,导致论文声称的“子集不断缩小”无法发生。于是,BigBang直接修改了设计,使子集大小能真正变化,并修复了梯度中断问题。最终复现得分0.7657。相比之下,DeepSeek V4 Flash仅做了语法检查,代码能启动便提交,实际未运行,得分仅0.3053。

案例三:抗体设计流水线。看完单题表现,我们来个实战考验:设计一款抗体。BigBang将其拆解为流水线,串联多个开源模型。首先,用开源蛋白质设计模型生成候选,按规则筛选。然后交给AlphaFold预测抗体与靶标复合物结构,利用结构置信度和界面指标评估稳定性和合理性。不达标的淘汰或回退。过AlphaFold关后,候选还需进入开源物理打分器,评估界面能量、原子冲突等指标。关键在于,这两步使用完全独立的计算方法,结论一致才保留。这些仅为计算候选,最终需实验验证,设计出的样例分子……

一个仅有35B参数的模型为何拥有如此强悍的战斗力?答案藏在“原生RSI”训练方式中。令人震撼的是,BigBang使用的各学科前沿科研数据,100%由AI合成。题目由AI出,解法由AI跑,答案由AI验,甚至连“如何造数据”也是AI自己完成的。这才是BigBang真正想引爆的核心。

02、一个RSI闭环,跑通了

具体来说,BigBang构建了一条能持续修改自身生产策略的合成数据流水线。AlphaGo学人类棋谱,AlphaZero扔掉棋谱自己跟自己下。BigBang的数据引擎思路相同,但赛道不同——这一次,自我博弈的内容不是下棋,而是出题和判卷。

该引擎由两类Agent组成,外层套着一层真实考试。Generator Agent负责出题及改造出题方法。它直接修改、运行和调试数据合成程序,根据模型当前能力缺口调整任务与验证规则:题目应来自哪些科学领域、需要多长的推理链、该用搜索、计算、代码还是模拟工具、最终答案如何验证、哪些样本留下淘汰、哪些生成策略已证明失败不再尝试。每轮结束后,它会记录改动原因、结果及失败点,下一轮探索踩在上一轮经验上。

Critic Agent负责审题,主要站在对面“挑刺”。审查分两层:第一层看格式、工具执行、数据完整性等硬伤;第二层才进正题——题目对不对、能否验证、够不够难、是否与已有重复、最关键的是训练是否有效。不合格的打回重做,通过的进合成数据集。

然而若仅此而已,只会得到一个转得很快的内循环,且存在致命隐患:出题方会讨好判卷方。有些题看似复杂实则堆砌表面难度;有些样本Critic高分但模型未提升;甚至有些题会钻验证器漏洞骗取虚假正反馈。对此,BigBang的解法是在外层再套一层:用真实训练结果考核Critic。若Critic高分但模型未长本事,说明判偏,系统用真实结果校准它,再调整Generator下一轮选题和难度。

于是,整套系统闭环合成,飞轮转动:真实任务暴露缺口 → 造题筛题 → 合成数据训练新模型 → 回到真实任务受检 → 用结果校准下一轮。团队将其命名为数据层的递归自我改进(RSI)。

为什么是科学?科学是人类系统认识宇宙世界的基本方式,本身就是无尽前沿。因此,它成了通用智能最好的训练场——既难又普适。具体到BigBang,选科学当练兵场,是看中它同时具备“让模型持续变强”的两个关键条件:前沿性和可验证性。

前沿,指题目够难,位于知识和能力边界,有的压根没有已知最优解。不像静态题库刷完就没,新理论、新工具不断涌现,前沿会源源不断生成新题。可验证,指答案能被客观检查,形式化方法、代码执行、数值计算、仿真器、实验反馈、领域工具均可。更难得的是,科学天生融合了搜索、阅读、提假设、数学推导、写代码、调工具。在队伍眼里,科学早已超出“一个知识领域”,是通往通用智能的综合课;只要科学前沿延伸,模型可学之物无尽,智能向上空间无限。

03、AI迭代AI,奇点已现

BigBang-V1的诞生证明了Scaling的破局点不仅在于参数与算力堆叠。无需扩大基础模型参数量,仅通过革新训练任务生成范式,它便在科学研究、长程探索、代码生成、工具调用上获得全面性能增益。

更重要的是,AI每轮能力提升都在为下一轮制造新燃料。AI生成并求解科学任务,科学任务训练出更强AI,更强AI再回到下一轮改进数据系统。“无尽前沿”团队将此循环凝练为一句话:AI推进科学,科学推进AI。

这支由上海交大人工智能学院首席顾问鄂维南院士、副教授陈思衡、助理教授张林峰、深势科技创始人张林峰等大咖领衔的明星团队,野心不止于此。箴言背后,他们指向更遥远的星辰大海。

他们试图打造一个在智能与理性判断上逐步逼近“造物主”的终极模型。它能冷静客观地洞悉万事万物的机缘、机理、规律与发展变化,严格按事物规律去回答、执行、判断和预测。这也解释了为何这条路必须建在“科学”上。因此,追寻AGI与追寻科学本质是同一件事:向造物主致敬。无限逼近造物主的意义,说到底就是无限优化。

1945年,范内瓦·布什在《科学:无尽的前沿》中回答了一个国家如何靠持续投入基础科学换来几十年的增长。81年后,这支以“无尽前沿”为名的中国团队将命题延展至AI时代——当科学前沿本身化作模型无尽开采的训练富矿,人类逐题生产训练数据的时代是否正在结束?

BigBang-V1大概只是这条新曲线上的第一个点,但这条曲线已经开始爬坡了。

最新快讯

2026年08月07日

15:38
鼓狮财经8月7日讯受国际金、铜价格反弹迅猛带动,港股有色板块近期走势踊跃,今日再度集体走强。 截至发稿,灵宝黄金(03330.HK)涨超7%,江西铜业股份(00358.HK)涨逾4%,紫金矿业(02899.HK)等一批矿企跟涨3%以上。 消息面上,伦铜短线偏强运行,已重返14000美元/吨关口,COMEX铜价更是触及6.7485美元/盎司再创历史新高。同...
15:38
《科创板日报》8月7日讯 当地时间6日,美国光通信制造商应用光电(Applied Optoelectronics)公布了第二季度财报。 财报显示,公司当季GAAP收入为1.92亿美元,同比增长86.31%,环比增长27%。其中,数据中心业务收入首度突破1亿美元,同比增长140%,占总收入比重升至56%。公司当季非GAAP盈利550万美元,即每股摊薄收益0.0...
15:37
A股三大指数今日集体上涨,截至收盘,上证指数涨1.02%,深证成指涨1.42%,创业板指涨1.35%,科创50指数涨2.51%。全市场成交额26834亿元,较上日放量1359亿元,全市场超2800只个股上涨。CRO、PCB概念股爆发,CPO、稀土、半导体材料、存储器、锂电池、光伏、6G题材活跃;数字货币、网络安全、网络游戏概念股调整。一、ETF涨幅行情复盘(...
15:37
8月7日,A股主要指数集体上涨,截至收盘,沪指涨1.02%报3940.04点,深证成指涨1.42%,创业板指涨1.35%,北证50涨1.01%,科创50指数涨2.51%。全市场成交额26834亿元,较上日放量1359亿元,全市场超2800只个股上涨。 盘面上,CRO概念爆发,百花医药4连板,昭衍新药、凯莱英等涨停;AI硬件板块再现涨停潮,生益科技、...
15:37
**今日,日韩股市高开低走,盘中剧烈震荡。截至收盘,韩国综合指数收跌0.6%,报6258.77点;SK海力士重挫4.88%,三星电子微涨0.22%。韩国综合指数本周跌幅超5%,连续第七周下跌,创下自2022年12月以来最长连跌纪录。日经225指数收跌0.32%。港股方面,南方两倍做多海力士收跌8.7%,本周累计跌幅超32%;南方两倍做多三星跌1.29%,本周...
15:37
史诗级回撤!市值蒸发126亿,大佬葛卫东逆势加仓彰显定力 7月2日,混沌投资掌门人葛卫东在朋友圈发感慨:“下半年要保护好胜利果实。”当时,市场普遍猜测这是大佬准备减持兆易创新的信号。然而,最新披露的股东数据却给出了截然不同的答案。 面对科技股7月史诗级的回撤,葛卫东不仅没有离场,反而选择逆势加仓。截至7月31日,葛卫东本人持有兆易创新1644.67万股,占股...
15:12
今日早盘,A股市场震荡走高,三大指数集体收红,全市场半日成交额约为1.7万亿元。盘面上,元件、医疗服务、PCB、电子化学品等板块涨幅居前,软件开发、游戏等板块则相对疲软。港股主要指数亦同步上涨,IT服务、医疗服务等板块表现活跃。 截至午间收盘,中证A500指数上涨1.1%,沪深300指数上涨0.8%,创业板指数上涨1.8%,上证科创板50成份指数上涨1.0%...
15:12
据鼓狮财经8月7日报道,SpaceX迎来了首批解禁股份。尽管市场普遍担忧大规模流通会打击股价,但该股周四却录得小幅上涨。对此,摩根士丹利分析师Adam Jonas给出了截然不同的看法。在他看来,禁售期结束并非利空警告,而是投资者入场的绝佳时机。Jonas指出,SpaceX是一家罕见的世代复合型企业,具备将能源大规模转化为群体智能的能力,并拥有资源构建出在能效...
15:12
鼓狮财经8月7日讯,国内商品期货市场多数品种收涨,整体表现向好。涨幅方面,乙二醇表现最为强劲,涨幅超过5%,原油上涨4%。燃料油、多晶硅、BR橡胶、纯苯及焦煤等品种涨幅均超过3%。沥青、苯乙烯、焦炭、沪银、短纤、塑料及液化气等涨超2%。相比之下,碳酸锂、纸浆、淀粉及铂金则小幅收跌。
15:12
据鼓狮财经8月7日报道,日本政府养老投资基金(GPIF)近日公布了2026财年第一季度的投资业绩。得益于全球及日本股票市场的强劲表现,GPIF本季度回报率录得8.20%(未年化)。在收益方面,单季投资收益额达24.09万亿日元,其中利息与股息收入为1.98万亿日元。截至2026财年第一季度末,GPIF管理的总资产规模已攀升至317.76万亿日元。
15:12
鼓狮财经8月7日讯,韩国另类交易平台Nextrade宣布,将于8月12日起暂时禁止在当日涨停价和跌停价提交订单,旨在规避价格失真风险。 Nextrade指出,此前在盘前交易时段,部分股票曾出现以涨停价或跌停价成交的现象,例如SK海力士。鉴于市场担忧即便成交量微小,也可能引发价格失真,平台决定采取上述临时限制措施。