AI领域正经历一场震动。今早,谷歌传奇人物Jeff Dean宣布离职,结束了27年的谷歌生涯。几乎在同一时间,他与三位顶尖伙伴创立的新公司“Discovery Loop”也正式亮相。从名字可以看出,他们押注的是目前AI领域最热门的方向——RSI,即递归自我改进。目标是让AI持续迭代进化,自动攻克机器学习、科学研究和工程技术领域的重大难题。

Discovery Loop代表了一条清晰的路线:用AI加速AI。未来,AI将彻底告别单纯的“问答模式”,全面接管“提出假设、执行实验、验证结论”的科研闭环。今天,中国团队也加入了这场竞赛。

01、BigBang-V1首秀:35B参数模型力克DeepSeek V4

由上海交大人工智能学院、深势科技及上海算法创新研究院组成的“无尽前沿团队”,已经完成了这一循环。他们推出了首个通过“原生RSI”训练的基座大模型——BigBang-V1,参数量为35B。

在可验证前沿任务的牵引下,利用100%纯AI合成的数据,BigBang-V1实现了性能的爆发式增长。在35B参数级别的评测中,它一举夺得十项第一。在OpenAI提出的“FrontierScience Research”科学基准上,它获得46.2分,击败了DeepSeek V4 Pro。

35B模型硬刚1.6T参数模型,在45倍的体量悬殊下,BigBang-V1完美诠释了“以小博大”的真正含义。它在各大高难度榜单上的战绩同样硬核:

在“Humanity’s Last Exam”(人类最后考试)基准上,BigBang获得50.3分,击败V4 Pro,表现堪比Gemini 3.1 Pro。这是一个由Scale AI在《Nature》正刊上提出的测试大模型综合推理能力的基准。

在OpenAI提出的“PaperBench (Code-Dev)”上,BigBang取得53.6分,V4 Pro仅为50.4分。该基准主要考察大模型复现AI学术论文的能力。

另一个由OpenAI提出、考察模型自主完成AI工程能力的基准“MLE-Bench (Lite)”上,BigBang也交出了59.1分的亮眼答卷。

此外,在更高难度的“BioMysteryBench Human-Difficult”上,它取得15.7分,V4 Pro为13.7分。这是Anthropic迄今推出的唯一基准测试,主要考察大模型解决生物信息学研究问题的能力——即给模型一堆带噪声的测序数据,要求其分析出精确且符合评分标准的生物学结论。

技术报告中的具体案例更能看清BigBang的优势:

案例一:精准找病毒。以BioMysteryBench评测中的一道生物学题目为例——三份人体肠道类器官的测序原始数据摆在面前,模型需判断感染的是哪种RNA病毒。BigBang运行三次,答案完全一致:诺如病毒GII.4,正确率3/3。而DeepSeek V4 Flash三次则给出了三种毫不相干的病毒,无一沾边。

案例二:复现论文并纠错。这次的任务是复现论文。BigBang在阅读过程中发现异常,通过测试发现问题出在论文本身:核心设定存在矛盾。关键量被固定,导致论文声称的“子集不断缩小”无法发生。于是,BigBang直接修改了设计,使子集大小能真正变化,并修复了梯度中断问题。最终复现得分0.7657。相比之下,DeepSeek V4 Flash仅做了语法检查,代码能启动便提交,实际未运行,得分仅0.3053。

案例三:抗体设计流水线。看完单题表现,我们来个实战考验:设计一款抗体。BigBang将其拆解为流水线,串联多个开源模型。首先,用开源蛋白质设计模型生成候选,按规则筛选。然后交给AlphaFold预测抗体与靶标复合物结构,利用结构置信度和界面指标评估稳定性和合理性。不达标的淘汰或回退。过AlphaFold关后,候选还需进入开源物理打分器,评估界面能量、原子冲突等指标。关键在于,这两步使用完全独立的计算方法,结论一致才保留。这些仅为计算候选,最终需实验验证,设计出的样例分子……

一个仅有35B参数的模型为何拥有如此强悍的战斗力?答案藏在“原生RSI”训练方式中。令人震撼的是,BigBang使用的各学科前沿科研数据,100%由AI合成。题目由AI出,解法由AI跑,答案由AI验,甚至连“如何造数据”也是AI自己完成的。这才是BigBang真正想引爆的核心。

02、一个RSI闭环,跑通了

具体来说,BigBang构建了一条能持续修改自身生产策略的合成数据流水线。AlphaGo学人类棋谱,AlphaZero扔掉棋谱自己跟自己下。BigBang的数据引擎思路相同,但赛道不同——这一次,自我博弈的内容不是下棋,而是出题和判卷。

该引擎由两类Agent组成,外层套着一层真实考试。Generator Agent负责出题及改造出题方法。它直接修改、运行和调试数据合成程序,根据模型当前能力缺口调整任务与验证规则:题目应来自哪些科学领域、需要多长的推理链、该用搜索、计算、代码还是模拟工具、最终答案如何验证、哪些样本留下淘汰、哪些生成策略已证明失败不再尝试。每轮结束后,它会记录改动原因、结果及失败点,下一轮探索踩在上一轮经验上。

Critic Agent负责审题,主要站在对面“挑刺”。审查分两层:第一层看格式、工具执行、数据完整性等硬伤;第二层才进正题——题目对不对、能否验证、够不够难、是否与已有重复、最关键的是训练是否有效。不合格的打回重做,通过的进合成数据集。

然而若仅此而已,只会得到一个转得很快的内循环,且存在致命隐患:出题方会讨好判卷方。有些题看似复杂实则堆砌表面难度;有些样本Critic高分但模型未提升;甚至有些题会钻验证器漏洞骗取虚假正反馈。对此,BigBang的解法是在外层再套一层:用真实训练结果考核Critic。若Critic高分但模型未长本事,说明判偏,系统用真实结果校准它,再调整Generator下一轮选题和难度。

于是,整套系统闭环合成,飞轮转动:真实任务暴露缺口 → 造题筛题 → 合成数据训练新模型 → 回到真实任务受检 → 用结果校准下一轮。团队将其命名为数据层的递归自我改进(RSI)。

为什么是科学?科学是人类系统认识宇宙世界的基本方式,本身就是无尽前沿。因此,它成了通用智能最好的训练场——既难又普适。具体到BigBang,选科学当练兵场,是看中它同时具备“让模型持续变强”的两个关键条件:前沿性和可验证性。

前沿,指题目够难,位于知识和能力边界,有的压根没有已知最优解。不像静态题库刷完就没,新理论、新工具不断涌现,前沿会源源不断生成新题。可验证,指答案能被客观检查,形式化方法、代码执行、数值计算、仿真器、实验反馈、领域工具均可。更难得的是,科学天生融合了搜索、阅读、提假设、数学推导、写代码、调工具。在队伍眼里,科学早已超出“一个知识领域”,是通往通用智能的综合课;只要科学前沿延伸,模型可学之物无尽,智能向上空间无限。

03、AI迭代AI,奇点已现

BigBang-V1的诞生证明了Scaling的破局点不仅在于参数与算力堆叠。无需扩大基础模型参数量,仅通过革新训练任务生成范式,它便在科学研究、长程探索、代码生成、工具调用上获得全面性能增益。

更重要的是,AI每轮能力提升都在为下一轮制造新燃料。AI生成并求解科学任务,科学任务训练出更强AI,更强AI再回到下一轮改进数据系统。“无尽前沿”团队将此循环凝练为一句话:AI推进科学,科学推进AI。

这支由上海交大人工智能学院首席顾问鄂维南院士、副教授陈思衡、助理教授张林峰、深势科技创始人张林峰等大咖领衔的明星团队,野心不止于此。箴言背后,他们指向更遥远的星辰大海。

他们试图打造一个在智能与理性判断上逐步逼近“造物主”的终极模型。它能冷静客观地洞悉万事万物的机缘、机理、规律与发展变化,严格按事物规律去回答、执行、判断和预测。这也解释了为何这条路必须建在“科学”上。因此,追寻AGI与追寻科学本质是同一件事:向造物主致敬。无限逼近造物主的意义,说到底就是无限优化。

1945年,范内瓦·布什在《科学:无尽的前沿》中回答了一个国家如何靠持续投入基础科学换来几十年的增长。81年后,这支以“无尽前沿”为名的中国团队将命题延展至AI时代——当科学前沿本身化作模型无尽开采的训练富矿,人类逐题生产训练数据的时代是否正在结束?

BigBang-V1大概只是这条新曲线上的第一个点,但这条曲线已经开始爬坡了。

最新快讯

2026年08月07日

14:41
资本市场的底层逻辑非常直白:利润流向哪里,资本就涌向哪里。在产业发展不同阶段,利润总是向最稀缺、议价能力最强的环节集中,而资本的逐利本性,也决定了它会在产业链各环节间迁徙。过去一年半,AI产业链的利润兑现权牢牢掌握在“卖铲人”手中,英伟达、台积电、ASML、SK海力士等企业股价大涨。但这种繁荣背后暗藏隐忧:除了英伟达GPU、台积电先进制程等少数高壁垒环节外,...
14:41
经历了一整年的市场嘲讽后,谷歌终于坐不住了。就在近日,谷歌 AI 部门传来了一连串重磅人事变动:DeepMind 联合创始人兼 CEO 哈萨比斯卸任;在谷歌效力近 27 年的元老级科学家杰夫·迪恩离职,并带走核心团队创办了 Discovery Loop 公司。此外,就在一周前,媒体刚曝出猛料:曾助力谷歌斩获 2024 年诺贝尔化学奖的 AlphaFold 团...
14:30
被誉为“人工智能教父”的计算机科学家杰弗里·辛顿于8月6日发出警告。在拉斯维加斯举行的Ai4峰会上,他表示随着人工智能技术的代际演进,人类或许将难以维持对大型语言模型的统治地位。 辛顿对媒体表示,当前人工智能的发展趋势是变得越来越智能。他认为,随着智能水平的提升,AI系统将展现出更复杂的意图,以及越来越强的摆脱人类控制的能力。“我不认为我们还能像过去那样,仅...
14:30
本周,沉寂已久的多晶硅市场终于迎来一波强势反弹。周一,受行业会议传闻刺激,多晶硅期货价格强势飙升9%触及涨停;在经历三天的横盘整理后,周五又因海外重磅政策刺激盘中大涨近6%,带动本周累计涨幅超过15%。A股硅料板块同步走强,龙头股通威股份今日涨幅突破5%,重新点燃了市场对该板块的交易热情。本轮行情的爆发主要依靠两大市场公认利好支撑:一是国内头部硅料企业集体开...
14:30
近日,国家能源局正式印发《电力安全生产“十五五”行动计划》。文件明确指出,将加强“人工智能+”安全治理,创新设备高精度故障预测及健康管理方法,推动人工智能技术嵌入智能安全工器具,并研究基于人工智能大模型的电力安全生产辅助决策技术。此外,还将加大关键电力装备自主研发力度,加强新型防护材料研发,设立电力装备核心部件技术攻关专项计划,重点突破电力芯片、特高压组部件...
14:10
一张证书,暂时还不会左右你的换机节奏。回溯到 7 月下旬,如果你密切关注手机行业,应该会注意到各大厂商纷纷官宣其产品通过了国家人工智能 L3 级认证。这轮集体官宣的起点,是 2026 年 7 月 17 日公布的首批人工智能终端智能化分级测试结果。根据首批名单,移动终端中共有 11 款产品达到 L3 级,包括 9 部手机和 2 台平板。手机阵营涵盖了华为、摩托...
14:10
大模型行业中,DeepSeek素以“价格屠夫”著称,如今却准备涨价了。8月6日,DeepSeek在用户后台发布公告,宣布计划近期上调API服务定价,并特别提醒用户此次“预计涨幅较大”,建议合理安排使用需求和充值金额。这一消息引发广泛关注,毕竟在过去两年Token价格战中,DeepSeek始终是那个带头掀桌子的人。如今率先将Token价格打下来,却主动宣布大幅...
14:10
OpenAI 刚刚完成 GPT-5.6 系列模型的大幅降价,随即又传出了新模型的消息。据外媒 The Information 报道,OpenAI 正筹备发布一款代号为“Astra”的新模型系列。该系列在执行长时间任务方面的能力将显著提升。知情人士透露,本周,OpenAI CEO 山姆·奥特曼已在华盛顿向政策制定者和监管机构演示了 Astra。 演示重点展示了...
13:57
今日早盘,创新药板块表现活跃,整体呈现震荡上行态势。截至午间收盘,多只医药相关指数涨幅显著。 具体来看,中证创新药产业指数领涨,上涨4.7%;中证生物科技主题指数紧随其后,上涨3.8%。港股通医药板块同样表现强劲,中证港股通医药卫生综合指数上涨3.0%,恒生港股通创新药指数上涨2.5%。A股医药板块方面,沪深300医药卫生指数录得3.2%的涨幅。
13:56
鼓狮财经8月7日电,据报道,尽管业内对近期杠杆类产品波动存在担忧,韩国交易所仍将于9月14日正式开启交易所交易基金(ETF)盘后交易。韩国交易所意在与另类交易系统Nextrade以及全天候加密货币交易所展开竞争。资管机构警示,缺少实时基金净值估算,可能会扩大ETF的价格偏离幅度;行业此前已呼吁韩国交易所推迟该业务上线。个股杠杆型ETF将不纳入盘后交易的交易标...
13:56
近年来,随着生成式人工智能的落地与云厂商数据中心的大规模扩张,美国主要科技巨头的资本开支自2024年起迅猛增长,占美国GDP的比重已快速攀升至10%。AI正成为美国经济增长的重要引擎,但在短期内可能对就业总量造成负面影响并改变就业结构。同时,AI发展带来的电力和芯片短缺也加剧了美国通胀压力。 受生成式AI落地及云厂商数据中心扩张驱动,美国主要科技公司资本开支...
13:56
一只基金换个名字,听起来似乎微不足道。但对于持有者来说,“两倍做多海力士”与“最多两倍做多海力士”之间,往往意味着成千上万人的回本希望就此破灭。 南方东英旗下的两倍做多海力士ETF(代码07709),自2025年10月上市以来,便搭乘着AI浪潮的东风。作为韩国半导体巨头SK海力士的HBM核心供应商,其正股股价一路飙升。这只产品也随之疯狂,在短短不到一年内,价...