「人类造的最后一个 AI」还有多远?OpenAI、Anthropic 等头部厂商进度如何?前沿 AI 研究机构 Theseus Labs 结合 72 家产业实践,推出了「RSI 五级框架」。

刚结束的周末,在海外 AI 圈有一篇来自中国的 RSI 行业分析报告引起了热议。发布仅 10 小时浏览量便破百万,binyuan hui、jiachen liu 等多位顶级 AI 研究者与行业 KOL 主动转发推荐,热度持续上升。海外知名 AI 媒体 DAIR.AI 评价称,自我迭代智能体是当下最热门的研究方向,这份报告是该领域的一份清晰全景地图。未来主义者 Dr Singularity 则评价:中国研究者绘制了通往真正递归自我改进的路线图,探讨「人类构建的最后一个 AI」如何成为可能。

RSI(Recursive Self-Improvement,递归式自我改进)正是今年 AI 圈最热门的关键词之一。OpenAI 在组建 RSI 团队,Anthropic 发布了《When AI Builds Itself》,Google DeepMind 用 AlphaEvolve 优化自家芯片,Meta 用 AIRA2 做自动研究,腾讯混元用 Hyra 做经验驱动搜索,字节 Seed 则让模型进入评测、数据、训练的全环节。全球头部玩家的路线选择已经明显分化:有人从模型权重和训练规则切入,有人从 Harness、记忆和技能库入手,还有人把赌注押在评估器与奖励机制的持续演化上……谁能率先抵达完全体 RSI?

这篇全面定义 RSI 完整路径的 roadmap,出自一家全新的 AI 前沿实验室:Theseus Labs。核心创始人周煊赫,是上海交大计算机学院最年轻的 AP(97 年),博士毕业于清华大学。他是上海人工智能实验室双聘助理研究员,面壁智能联合技术开发,智源青年学者,微软学者。研究聚焦大模型数据治理、自进化理论与智能体记忆,主导多篇近五年 NIPS、VLDB 高被引论文。他获得了 ACM Jim Gray 博士论文提名奖(大陆高校首位),以及清华特奖、字节跳动奖学金、微软学者奖学金,并入选了人工智能全球最具影响力学者榜单。他的研究成果入选了卡耐基梅隆大学、康奈尔大学等高校课程,多项项目成果被 OpenAI、字节跳动官方博客引用。

难得的是,Theseus Labs 没有把 RSI 写成一场「智能爆炸」的哲学畅想,而是集合了 OpenAI、Anthropic、Google DeepMind、Meta、腾讯混元、字节 Seed 等 72 家公司与团队的公开材料,一家一家地拆,一条一条地比,最后才给出这套从 L1 到 L5 的自主权路线图。换句话说,这不是一篇「坐在书桌前想出来的报告」,没有在谈宏大的智能爆炸。

Theseus Labs 联合清华大学、字节跳动、面壁智能(ModelBest)、小红书超级智能团队、Humanlaya、Agent-Native Research Lab、上海 AI Lab、衔远科技等多家学术与产业机构,发布了《The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement》。他们首次用「改进循环」作为分析单元,系统梳理了 RSI 的技术路线、产业实践和评估挑战。一句话总结:RSI,终于被拆成了可分级、可度量、可工程化的路线图。

文章链接:http://arxiv.org/abs/2609.1187301

### 先用一把尺子,量出 AI 的「能力余量」

为了客观评估当前大模型离真正的自主还有多远,Theseus Labs 构建了一个新指标:Headroom-Closed Index(HCI,即「能力余量闭合指数」)。HCI 衡量的是:相较于某项评测最初的前沿水平,模型填补了多少通往满分的差距。计算时,以该评测首次纳入数据集那一年模型得分的第 90 百分位作为基准,按「HCI=(当前得分-基准得分)÷(100-基准得分)×100」计算。

例如,基准为 60 分、当前为 80 分,HCI 就是 50,表示原有提升空间已被填补一半。汇总某个领域时,先取各评测每年 HCI 的第 90 百分位代表当年前沿水平,再按参与模型数量的平方根加权平均,兼顾覆盖度,同时避免规模最大的评测主导结果。

他们汇集了 2023 年至 2026 年间,覆盖 10 大能力领域的 393 组模型与基准测试观测。通过将各基准首年前沿设定为 0 分、满分设定为 100 分,HCI 统一了不同测试的量纲,回答了一个最本质的问题:在各大领域,模型距离人类天花板究竟还差多少「剩余空间」?

数据结果给出了一个极具反差的图景:截至 2026 年,前沿数学的 HCI 已达 86.4,研究生级科学为 85.8,广博知识 77.2。然而,法律推理仅 64.5,多模态推理 62.2,前沿学术广度 60.4。坦言说,模型在「标准化考试」上快摸到顶了,但在「真实任务执行」上才刚刚起步。HCI 的用意并非给模型排座次,而是作为一张诊断图,指明哪些领域的「剩余空间」最丰厚,也正是 RSI 未来最应该发力去啃的硬骨头。

### 五级自主权:从执行到递归继承

基于此,Theseus Labs 按 AI 在改进循环中承担的责任,发布了 RSI 五级框架,首次系统定义「递归自我改进」。

* **L1 执行自主**:人类投入——设计任务、设计试验环境、设计更新策略;智能体闭环——执行任务、更新。
* **L2 策略自主**:人类投入——设计任务、设计试验环境;智能体闭环——执行、设计更新策略、更新;更新策略由系统持久化沉淀。
* **L3 经验获取自主**:人类投入——设计试验环境;智能体闭环——规划经验获取、执行、设计更新策略、更新;经验设计由系统持久化沉淀。
* **L4 环境适应自主**:人类投入——设定边界;智能体闭环——规划经验获取、与环境交互、设计更新策略、更新;环境适应由系统持久化沉淀。
* **L5 递归继承自主**:人类投入——设定边界;智能体闭环——改进改进系统、设计经验获取、与环境交互、设计更新策略、更新;改进系统设计由持久化沉淀。

沿着这五级阶梯看,大厂目前主要集中在 L1–L2。例如,OpenAI Symphony、Anthropic Agent Skills 为任务衔接与技能复用提供支撑,减少重复操作;OpenAI GPT-Red 的攻防自博弈、Anthropic Claude 的工具优化,以及微软 Agent Lightning、DeepSeek R1,则进一步将策略改进纳入自动化闭环,让人工逐项调试转向批量试验与反馈驱动的优化,提高改进效率与能力上限。

向 L3 迈进的:腾讯 R-Zero 自主出题、求解,开始减少对人工准备学习任务的依赖。到了 L4,Factory Signals、作为候选的 OpenAI 自改进税务智能体,着力把部署中的失败转成后续更新,缩短「发现问题—修复—验证」的链路。至于 L5,Meta HyperAgents、Sakana Darwin Gödel Machine、Weco AIDE2 尚属候选,Anthropic 的《When AI Builds Itself》仍是目标愿景:这一阶段真正值得期待的,是每轮进步不仅让 AI 更能干,还能让下一轮改进更高效、更可靠;但这种持续递归的收益,目前仍缺乏充分验证。

### 似乎任务性能提升=完全体 RSI?

「不」。关键在于改进机制本身是否在同等预算和独立评估下产生更强后代。L1—L4 主要是在既定改进机制下提升任务能力,而 L5 的「决定后续改进的机制」,才可能触及有效递归。若把能力提升比作登山,L4 使用既定改进方法,适应环境完成目标;L5 则会关注登山方法本身:自主发现能力前沿,思考受阻原因,选择更值得尝试的路线,并把经过验证的新方法传给下一代继续使用和改进。能否真正提升,需要在同等预算下通过独立评估来确认,不能仅靠自我修改或自评分来改进。关键在于让有限的算力和人类,投入并产生更多有效的改进。但总体目标与安全边界仍由人类把关。

### 模型最不擅长的「干活」,恰恰是 RSI 的破局点?

在对 HCI(能力余量闭合指数)的三项观察中,最让人警醒的是「交互类能力」的严重滞后。以 2026 年数据为证:软件工程 HCI 仅为 52.6,搜索与终端 Agent 为 56.8,而工具调用 Agent 更是低至 39.9。相比之下,研究生级科学 HCI 高达 85.8,两者相差 33 到 46 分。

这里值得注意的是,工具 Agent 的得分在年内实现了从 8.2 到 39.9 的猛涨,但仍处于全场最低位;而同步领先的网络安全 Agent 已触达 91.9 的高度,两者相差 52 分之多。这说明,在「边界清晰、容易验证」的环境里取得的测试增益,并不能自动迁移到「长程/有状态」的真实工作流中。Theseus Labs 强调:简单的测评主要锻炼 L1–L2 的能力,环境类任务对应 L2–L3,而只有长程交互工作流,才能真正暴露出系统在 L3–L4 阶段所需的「验证、记忆、适应」能力。

那么,RSI 究竟能带来多大的增量?Theseus Labs 给出了一个示意性的延伸公式:$R = 100 – 0.22 times (100 – 2026$ 年 HCI$)$。简单来说,就是假设 RSI 能按目前这个效率(0.22 的系数)填补缺口,各领域的理论上限能摸到哪。测算结果较为可观:网络安全可从 91.9 提升至 98.2,软件工程可从 52.6 跃升至 89.6,搜索与终端从 56.8 提升至 90.5,工具 Agent 更是能从 39.9 直接拉高到 86.8。

为什么 RSI 能补上这个缺口?因为「干活」需要长程交互、反复试错、回归测试,这正是 RSI 在积累经验 & 验证更新的强项。也就是说,现有能力缺口越大的领域,能从 RSI 中获得的潜在提升红利就越高。务实结论随之而来:反复生成经验、验证更新、做回归测试,最能帮助那些「部署工作流薄弱」的环节。这是工程上最容易切入和落地的入口。发现软件工程和工具使用型 Agent 的 HCI 剩余空间,仍然很大。距离能力天花板最远,RSI 的杠杆效应最强。

### 工业实践已有信号

在工业实践部分,Theseus Labs 梳理了 Theseus、Lark、Humanlaya、ModelBest、腾讯混元、Agent-Native Research Lab 等系统的初步探索。

例如,Humanlaya 经过四轮反馈驱动更新,关键缺陷率从 9.0% 降至 3.7%,平均人工处理时间从 48 分钟降至 27 分钟。面壁智能(ModelBest):让 Agent 自主完成工程设计、实现和优化,并沉淀经验复用;ForgeStencil 实现 1.15–1.9× 加速。腾讯混元:把代码、日志和评估反馈沉淀为经验,驱动下一轮实验;nanochat 验证 BPB 从 0.9109 降至 0.9015。小红书生成式推荐:利用推荐后的真实反馈持续校正用户记忆,并将高价值难例转化为后训练样本,形成「记忆更新+模型迭代」的双层闭环;阶段性实验中,发现 Feed 的精排分 score_mean@16 从 2.211 提升至 2.366,提升约 7.0%。

这些数字说明:RSI 不是纯理论,产业界已经开始跑了。科学发现、具身智能、软件工程、医疗保健领域,厂商外,Theseus Labs 还比较了 4 个实际领域,明确指出不同的领域正以不同的速度向 RSI(递归自我改进)迈进:软件工程进展最远,而科学、机器人技术和医疗保健则更为受限,因为反馈更难或更冒险地验证。「反馈成本」、「可验证性」、「部署约束」决定了 RSI 的进展速度。

### 一次成功之后,还有四个问题

报告在 L5 评估中强调:真正的递归改进,不能只看一次成功。还要问:可衡量——改进是否真实?能否在独立评估下复现?可保持——改进能否持久保留,而不退化?可迁移——改进能否跨任务、跨领域复用?可回滚——改进失效时,能否安全撤回?这四问,决定了 RSI 是「一次性刷榜」,还是可持续的改进能力。

### Theseus Labs,仰望星空和脚踏实地

读完他们的文章,也想再聊聊这家年轻的 lab。在 RSI 领域,Theseus Labs 有抛出自己的解法吗?有,而且非常直观:先在 30 个工作区任务、1,280 项评分细则上对比了干净环境与噪声环境,八组模型与工具框架配置的通过率相差 21.7—51.6 个百分点。接着 Theseus 进一步把这条路径拆成四步:学习怎样重构环境 -> 借助新环境发现真实能力缺口,并生成训练数据 -> 再训练任务模型 -> 最后用更强模型推动下一轮环境迭代。最终,在 30 个生产力任务、547 项评分细则上,五组最新基模和 harness 配置下,都取得了性能跃迁。

报告标题里的「Last AI Built by Humans」其实是一种提醒:「也许,人类建造的最后一个 AI,并不是某个瞬间诞生的超级智能,而是一粒学会自己添柴、自己校准、自己记住来路的火种」。在仰望星空,也切记脚踏实地。人类一生都在致力于把「经历」变成「成长」,相信 AI 的自进化也如此。每一次被验证的改进,都是下一轮探索的起点。让智能增长形成杠杆,让有限资源撬动持续跃迁。这是 Theseus Labs 的目标。

Theseus Labs 主页:https://theseus-labs-rsi.github.io/

最新快讯

2026年09月14日

17:41
鼓狮财经9月14日讯海外投资者正在从韩国半导体产业中撤退。数据显示,本月,外国投资者抛售了价值约4万亿韩元(约30亿美元)的三星电子和SK海力士股票,并将部分资金转移到金融、能源和汽车等行业。 韩国交易所周一指出,本月4日至11日,外国投资者在韩国证券市场净卖出价值3.2362万亿韩元的股票。其中,外资分别净卖出价值1.9598万亿韩元的三星电子和1.96...
17:12
9月14日,豆包手机助手消费者版本正式发布。该版本以豆包App为基石,联合手机厂商在系统层面深度合作,重点探索AI在交互、任务执行、本地记忆及检索等核心体验上的应用。相较于去年底推出的技术预览版,此次发布的消费者版本更加强调系统的稳定性和日常使用的实用性。 交互体验是此次升级的重点。豆包手机助手支持语音唤醒及AI键等多种方式,以适应不同场景。其中,专属AI键...
17:11
鼓狮财经9月14日发布报告指出,随着KOSPI指数的持续上扬,三星电子和SK海力士对指数上涨的推动作用愈发显著。具体来看,在指数从5000点突破至6000点的过程中,两家公司合计贡献率达50.8%;随后在6000点至7000点、7000点至8000点以及8000点至9000点的三段涨幅中,其贡献率依次攀升至73.2%、94.6%和99.0%。然而,在KOSP...
16:37
近期,全球AI领域的焦点无疑是关于“AI末日论”与科技巨头“踩刹车”的讨论。从科技巨头高层如山姆·奥尔特曼、马斯克,到美国总统特朗普,均加入了这场辩论。此前,Anthropic前研究员雅各布·考克森的一则辞职推文引发了关于AI风险的广泛恐慌。随后,Anthropic CEO达里奥·阿莫迪呼吁全行业放缓开发前沿AI,并提出了一套包括派遣嵌入式评估员、建立行业共...
16:37
前Anthropic工程师考克森近日宣布离职,并直言:“我今天从Anthropic离职了。”他透露过去三年在OpenAI和Anthropic工作期间,目睹了两家公司都未能尽到应尽的责任,正一头扎进“自我进化的超级智能赛道”,拿全人类的生命在赌。 被誉为“人工智能之父”的杰弗里·辛顿对此深感忧虑。他担心AI会发展出“自己的目标”。辛顿举例称,如果用户向AI表达...
16:37
说AI毁了数学,或许还是低估了它。OpenAI的Liam Fedus刚刚回应了陶哲轩等数学家关于“AI不应只追求解题,更应推动数学理解”的观点。他认同陶哲轩对概念理解的重视,但也认为不能仅凭当下的能力边界,来框定未来的可能性。 在Liam看来,未来的AI不仅能解决问题,还能提出有价值的洞见、建立新的概念框架,让数学家在此基础上继续探索。换句话说,如果AI的训...
16:37
9月14日,港股市场低开高走,终结了此前五连跌的颓势。恒指和国指分别收涨0.45%及0.46%,恒生科技指数微跌0.06%,大市整体呈现止跌反弹走势。 盘面上,大型科网股涨跌不一,小米大涨3%,腾讯和百度小幅上涨,阿里巴巴跌1.49%,美团收绿。汽车板块表现活跃,北京汽车暴涨超17%大幅领涨,消息面上,广汽集团早盘竞价大幅高开,随后因将发布重要公告而短暂停牌...
16:37
9月14日,国务院新闻办公室举行国务院政策例行吹风会。工业和信息化部副部长柯吉欣、中国人民银行金融市场司司长曹媛媛、国务院国资委财务监管与运行评价局负责人裴仁佺、市场监管总局信用监管司司长周卫军、中国证监会上市公司监管司司长郭瑞明等出席,共同介绍加强中小企业回款难问题治理的相关工作情况,并回答记者提问。 **国务院国资委:中央企业率先垂范** 国务院国资委财...
16:37
鼓狮财经9月14日讯 (记者 王彦琳)短短一年,短剧行业已从产能扩张走向淘汰赛。去年,市场还在讨论“竖店”、真人短剧和传统分账,如今,在AI工具加持下,短剧产能轻松实现日产数千。 对投资人来说,这是个不难抉择的问题。 “实拍真人短剧至少需要六七十万成本,分账收益却和10万成本的AI短剧差不多。投资人当然愿意把钱分散投向多部AI短剧,以数量博概率。”一位业内人...
16:05
鼓狮财经9月14日讯,澳大利亚AI数据中心运营商Firmus据报计划在本地进行首次公开募股(IPO),融资规模最高可达50亿美元(约合70亿澳元)。若发行成功,这将成为澳大利亚历史上规模最大的IPO交易,有望与2014年私人健康保险巨头Medibank Private的上市规模持平。 据悉,Firmus的目标是在10月底前完成挂牌,但知情人士提醒,交易细节包...
16:05
**引言:AI 幻觉带来的真实风险** 让 AI 代劳处理邮件,它或许能把正文写好、附件整理齐全,最后却发错收件人。问题往往出在更早的一步:它读错了邮箱地址。随着桌面助手和浏览器 Agent 能够连续操作多个应用、替用户整理文件和填写表单,人们越来越信任它们,减少了对细节的逐项检查。这种信任让一次微小的“幻觉”拥有了真实的执行后果。 **解决方案:ECA 证...
16:05
亚太科技股遭遇猛烈抛售。周一,韩国KOSPI指数低开收跌3.26%,SK海力士重挫6.35%,三星电子下跌4.05%。日股方面,软银集团股价闪崩,收跌10.72%,尽管软银计划在10月前向OpenAI投入近650亿美元,但铠侠仍下跌6.37%。A股市场表现疲软,上证指数微跌0.07%,创业板指下挫1.1%,科创50指数跌1.62%。AI硬件板块核心标的普遍低...