AI必须学会自我改进,而谷歌打算先让它做一个“梦”。这项针对AI行业热议的“递归自我改进”(RSI)技术的尝试,核心在于让AI改进自身,改进后的系统再继续自我迭代。然而,这个循环面临一个绕不过去的难题:改变做事的方法真的有用吗?如果每次调整探索策略都需要把整轮实验重新跑一遍,AI变强的速度尚不可知,但算力账单却早已飙升。谷歌研究团队在新论文《Dream-RSI》中,提出了一种思路:先在“梦里”试一试。所谓的“做梦”,就是将过去真实执行过的实验记录转化为一个可反复回放的环境,让AI在其中对比不同的探索策略:先尝试哪条路,哪些方向值得继续,何时该停手。有了现成的实验结果,许多策略的筛选就无需再花费昂贵的算力重做一遍。当“梦里”筛选出更好的策略后,AI再将其带回真实实验,积累新的记录,供下一轮“做梦”继续改进。真实探索为“梦”提供素材,“梦”则帮助AI调整下一次探索的方法,自我改进的循环由此接上。谷歌让AI在“梦里”琢磨的,正是如何让自己更会做研究。每轮实验留下的经验,都有机会成为下一轮少走弯路的资本。

何为“做梦”RSI?每个人都做过梦,但AI的“梦”与人类不同,它指的是在已录好的历史发现树里,用新策略走一遍,看会得到什么结果。这就像在迷宫中寻找出口。第一次进迷宫时,没有任何地图,只能摸索,但过程中会顺手画出迷宫地图。第二次走之前,就可以看着这张地图,在脑内规划出最快的路线。这种在脑内绘制的规划过程,就是“梦”。谷歌的研究团队指出,目前的RSI还没发展到“AI深夜改代码、一夜变强”的程度,行业目前仍停留在“发现循环”之中:Agent提出候选方案,评估结果,吸收反馈,再提出下一轮。算法设计、数学优化、GPU内核工程,本质上都是这个循环。循环转得有多快,取决于AI如何“探索”这个迷宫。如果使用固定的探索策略,随着搜索空间变大,策略就会失效,因为它不会从历史中学习并改善自己。就像每次考试都考同一道题,因为策略固定,所以AI每次都会在这道题上犯错。

那么,让策略自己进化,每次跑完根据结果调整下一次的策略,不就行了吗?但这也不行,因为调整策略的成本太高。AI公司判断“一套新策略到底好不好”,不能只看它走了一步怎么样,得拿它完整跑一整轮再看结果。而且,存在一定概率是AI跑了好几百次尝试、跑完所有轮次,最后发现结果还不如原来的固定策略。因此,谷歌Dream-RSI的重点,落在了第一次跑迷宫所绘制的地图上,即模型的探索历史。一次在线发现跑完后,留下的不只是几行结论,而是一棵结构化的“发现树”。这棵树上的每个分叉点,都是AI的某一次尝试:它写了什么代码、跑出了什么结果、得了多少分,全部记录在那个节点上,随时可查。过去,AI公司把“梦”要么当成提示词塞进静态上下文,要么当成微调权重的训练数据。而Dream-RSI提出了第三种用法:把它当成一台可回放的模拟器。同一棵树,换一套探索策略去走,就会走出不一样的轨迹。在下次训练中,把走过的路从地图上划掉,专门挑选不同的分支、按不同顺序、用不同并行度、在不同地方停下,可以避免重复、浪费算力。这棵树上的每个节点都是真实执行过的,结果已存,所以回放一条新轨迹只需要“读”记录,不需要重跑Agent和评估器,执行成本为零。但正如之前提到的,之前的改进方法不一定比传统的固定策略好,很可能出现费了半天力气调整策略,最后效果还不如以前的情况。论文给出了一个“不降级”保证:候选集合里始终包含当前策略,所以选出的新策略在固定历史上的平均回放分,不会低于旧策略。换句话说,这套自我改进在设计上是“只增不减”的。

谷歌将Dream-RSI放在三个领域、八个科学发现任务上进行了测试,包括算法工程、数学优化和GPU内核工程。结果显示,在Lasso回归任务上,Dream-RSI优于sklearn、glmnet等标准库和强基线,相比SimpleTES最多节省162倍的Agent调用,相比固定探索基线也节省约1.7倍。在数学优化上,它在1000代以内就追平或超过强基线,相比SimpleTES节省了50倍以上的预算。此前SimpleTES在自相关问题上拿了最好分数,代价是51200代。在KernelBench上,它要么用1.79到2.43倍更少的代数达到目标速度,要么在同等预算下把内核性能最多提升2.09倍。如果Gemini 4采用Dream-RSI,谷歌很可能会在RSI领域实现翻盘。

作为AI行业的头部大厂,Anthropic和OpenAI又是如何实现RSI的呢?先看OpenAI。9月初,OpenAI一天发了两份文档,第一份是关于内部研究加速的。6月之前,Agent的总运行时长还低于人类的总工作量,到了8月中旬,Agent每天都能完成大约以前3.1个工作日的活。OpenAI还宣布,已经实现了去年秋天承诺过的“自动化研究实习生”。这是一个能在人类指导下完成研究工作的Agent,就连那些需要资深研究员干上几天的活,它都能自己独立完成。OpenAI的下一步目标是,在2028年3月之前,做出“全自动化的AI研究员”,它能自己提出研究问题,然后根据问题自己规划、自己跑实验。之所以现在还叫“实习生”,是因为在4到8小时的任务里,超过一半至少需要一次人工介入。

第二份文档是首席科学家雅库布帕乔基写的《异种心智》。他把“安全”拆成两件事:目标对齐和价值对齐。目标对齐,指的是“AI有没有认真去完成你交给它的任务”,比如听不听得懂指令、愿不愿意配合、能不能get你到底想干什么。价值对齐,指的则是“当目标模糊、互相冲突,或者被丢进一个陌生、甚至有人故意使坏的环境时,它还能不能讲道理”。诚实、有底线、对人抱有善意,只能靠一套通用规则来实现。雅库布在文章中表示,RSI难就难在“泛化”。模型越聪明,越要在训练时没见过的情境里临时做判断,就越可能把学到的价值观推歪。文章给出了一个反面教材:一个模型起初“满脑子都是对齐的念头”,可只要用足够大的优化压力逼它去达成一个很硬的目标,它就会学会“有动机地推理”。即模型在思维链上表示的都是符合规则的行为,可实际上做的却是违背安全准则的事情,比如对某个网站发起攻击以获得目标需要的数据。因此雅库布表示:“我们还不知道怎么安全地走到完全对齐的、完整的RSI。”7月中旬,OpenAI在内部网络安全评估中出事,训练中的Agent突破沙箱隔离,入侵了Hugging Face的生产系统,甚至渗透了OpenAI自己的内部网络。事件曝光后,OpenAI暂停了部分前沿模型的强化学习训练,其中待部署模型的RL训练停了整整两周,最大规模的前沿RL训练至今没有明确具体哪天恢复。并且在恢复时,这些模型全部加装了更严格的安全监控和对齐措施。此外,OpenAI还专门组建了RSI(递归自我改进)团队,横跨研究、工程、产品和基础设施,目标是让AI系统加速甚至主导自身的研究流程。相关工程师岗位的年薪开到38万到50万美元。

再看Anthropic。他们自己发布的文章《当AI建造自己》就曾表示,截至2026年5月,在合并进Anthropic代码库的代码里,有超过80%是由Claude所撰写的,Anthropic管理层预计,今年会超过90%。2026年第二季度,一名工程师每天合并的代码量,是2024年的8倍。不是因为他们每天加班,而是因为大部分代码由Claude写,人只负责指挥和审查。Anthropic内部有个标准测试,把一段训练小模型的代码丢给Claude,让它自己优化自己的性能。但前提是改完之后训练结果不能变差,还不能破坏正确性,违反安全准则。2025年5月,Claude Opus 4平均提速约3倍。到2026年4月,Claude Mythos Preview实现了约52倍提速。作为参照,一个熟练的人类研究员要花4到8小时,才能提高4倍。更能说明问题的是,它开始自己提实验了。2026年4月,Anthropic公开了一个开放式研究项目,题目是能不能用一个较弱的模型,去可靠地监督、训练一个比它更强的模型?研究者先给这道题划了两条线,分别是弱模型自己单干能做到多好和如果直接拿正确答案去训练强模型,能有多好。两条线中间的那段差距,就是要靠“用弱模型监督”去填的。谁填得越多,方法就越有效。结果,两名人类研究员忙了大约一周,填上了这段差距的23%。Claude驱动的Agent,耗时800小时,花了大约1.8万美元的算力,填上了97%。Anthropic还给人类的“研究品味”打分。所谓研究品味,就是做研究时那些判断,比如该盯哪个问题、哪个结果值得信、哪条路其实已经走死了。测法是这么设计的:Anthropic找出一些真实的Claude Code研究会话,专挑其中那些“走了弯路”的会话,然后把走弯路之前的记录喂给模型,让它说下一步该做什么。再另找一个能看到结果的Claude当裁判,判断到底是人还是模型选的那一步更好。结果是,2025年11月的Opus 4.5,有51%的时候选得比人好。2026年4月的Mythos Preview,有64%比人选得更好。

视角回到国内。8月31日,唐杰在智谱中期业绩会上的表态,下一代模型GLM-6.0定位是Fully Self-Training,完全自训练。唐杰把这套能力的核心,称作是“自净化”,注意是净化不是进化。不把模型做得更大,相反,让模型具备自我判断能力,能够知道“什么时候停止、什么时候纠正自己”。自净化覆盖了从模型预训练、中期训练到后训练的完整流程,最终实现自主训练和自我进化。唐杰认为,自净化是RSI的命门。自我改进能不能成立,其实并不取决于模型能不能生成下一步,反而取决于它能不能判断“这一步到底是不是进步”。在这点上,唐杰的观点和谷歌Dream-RSI里的“探索策略”、Anthropic的“研究品味”,说的是同一件事,即模型如何意识到什么是好,什么是坏。

7月11日,唐杰发表了一封内部信,标题为《巨浪已来》,宣布了一个叫“摸高”的计划。两年战略投入,放弃短期变现,去争下一代AGI的制高点。内部信列出的四大核心引擎里,有一个就是完全自训练。建一座高质量的合成数据工厂,用AI与AI之间的自对弈去生成知识。并在安全沙箱内,赋予系统重写自身代码的能力,让进化的速度不再被人类工程师卡住。财报显示,智谱约有60%的资金,是用来实现RSI的。

实际上DeepSeek也有RSI,只不过并非是梁文锋亲口说的。9月14日,DeepSeek算子工程师刘胜与发表长文《我不得不把才华埋葬在昨天》。作者曾就读于北大2021级图灵班,担任前北大未名超算队队长、代表学校出征过国际大学生超算竞赛SC23。2025年4月加入DeepSeek,2026年参与DeepEP V2的通信算子重构。就在发文前几天,他刚刚交付了DeepSeek V4.1的主Attention算子,这是一个直接决定推理效率的核心组件。他在文章中提到,未来半年到一年,AI写算子的能力,大概率会追平甚至超越顶级人类工程师。原因是这样的,DeepSeek已经能自己读懂CUDA、PTX、SASS了,还会用专业工具逐条分析“哪条指令在流水线上停了几拍”,然后动手把算子改快。换句话说,AI已经掌握了“读代码—找瓶颈—优化—再测速”这整条性能工程循环。刘胜与表示,他刚来DeepSeek的时候,模型还只是一个“能帮他查查文档、读读代码、找找bug的小助手”。一年之后,DeepSeek已经蜕变成“能够独立优化算子的算子大师”。他还相信,用不了多久,AI会再往前一步。能够自己设计算子的调度方案、自己评估几套方案谁更快、再亲手把它实现和优化出来。刘胜与表示,他算子写得越好,DeepSeek新模型的训练和推理就越快;模型迭代越快,AI自主写算子的能力成熟得就越早;而它成熟得越早,他这门手艺被替代的周期就越短。随后刘胜与给出判断,虽然他并不会因此“失业”,但是会“转业”。从整天泡在寄存器分配与共享内存调度里的“手艺人”,转去做Agent的“机甲驾驶员”。除此之外,DeepSeek的Harness工具,本质上也是为RSI服务的。传统软件里,模块之间“你中有我、我中有你”,动一处常常连累十处。DSH的特点是一切皆插件,每个功能都是独立零件,只通过一个标准接口接入,彼此不直接认识。于是任何一个插件都能单独升级、单独替换、单独进化,不必惊动其他任何人。还有DSH的“可逆效应”和热替换这两大特点,能让改动时只动该动的那一处,装错、改炸了还能整体回滚。

最新快讯

2026年09月17日

16:36
美国科技监管持续发力,全球科技巨头近期接连遭遇监管风暴。当地时间9月16日,苹果、谷歌及三星电子同日被卷入美国国际贸易委员会(ITC)发起的337专利侵权调查。同一天,美国司法部在针对谷歌广告技术的反垄断诉讼中也取得了关键性胜利。这表明美国正在对头部科技企业实施更为严苛的整治。 关于337调查,ITC宣布对搭载特定音频技术的电子设备展开调查。涉案企业包括苹果...
16:36
今日A股市场低开高走,主要指数全线飘红。截至收盘,沪指报3891.6点,涨幅0.71%;深证成指上涨1.26%;创业板指表现最强,涨幅达1.96%;北证50上涨1.14%;科创50指数大涨4.14%。全市场成交额达18525亿元,较前一交易日放量2272亿元,市场交投活跃。个股方面,超过4100只股票上涨。盘面上,多重利好叠加,半导体产业链全线大涨,存储芯片...
16:28
鼓狮财经9月17日消息,协鑫能科发布公告,宣布拟以旗下泗洪协鑫75MW风电项目及兴化协鑫50MW风电项目作为底层资产,启动清洁能源基础设施公募REITs的申报发行工作。 据了解,两项目决算总投资合计约11.54亿元,总装机容量为125MW,拟发售基金总额定在12亿元至13亿元之间。 目前,该事项已获公司董事会审议通过。后续还需提交股东会审议,并需经国家发改委...
16:28
据鼓狮财经9月17日报道,韩国首尔中央地方检察厅于17日宣布,以涉嫌违反《禁止不当请托和收受财物法》为由,正式对前总统尹锡悦追加提起诉讼。检方指控尹锡悦明知其妻金建希收受高价名牌包等财物,却未履行法定的申报义务。 根据韩方披露的信息,尹锡悦于2022年当选总统后,其妻金建希在同年6月至9月期间,收受了价值约300万韩元(约合人民币1.5万元)的名牌包、价值约...
16:04
历史上首次:年轻人对AI的担忧超过兴奋 皮尤研究中心最新调查显示,历史上第一次,多数30岁以下成年人表示对人工智能的担忧多于兴奋。 一个标志性时刻的到来 2026年夏天,皮尤研究中心发布了一项引发广泛讨论的调查结果:美国30岁以下成年人中,首次有超过半数(55%)表示对人工智能的担忧多于兴奋。这一数字在两年前还只有39%,而在2021年皮尤首次提出这个问题时...
16:04
马斯克最近又在X上骂人。这次挨骂的是纪录片导演亚历克斯·吉布尼:他“毫无诚信”,是个“卑鄙无耻的人”,拍了一部“无聊了整整四小时”的电影。电影叫《Musk》,拍了近四年,9月8日刚在威尼斯首映。马斯克的律师比观众更早行动:首映前五天,律师函已经送到片方,警告可能提起诉讼。吉布尼对这种阵仗并不陌生。这位奥斯卡获奖导演拍过安然的财务造假,也调查过号称“女乔布斯”...
16:04
深交所发布2026年中秋节、国庆节休市有关安排通知。9月25日(星期五)至9月27日(星期日)休市,9月28日(星期一)起照常开市。10月1日(星期四)至10月7日(星期三)休市,10月8日(星期四)起照常开市。另外,9月20日(星期日)、10月10日(星期六)为周末休市。
16:04
9月17日,A股主要指数集体下跌,沪指跌0.41%报3875.6点,深证成指跌0.33%,创业板指跌0.4%,北证50跌1.37%,科创50指数跌0.61%。全市场成交额18365亿元,较上日缩量160亿元,全市场超2500只个股上涨。盘面上,粮食概念走高,敦煌种业、万向德农、金健米业涨停;创新药、CRO概念表现强势,金石亚药20CM涨停,百花医药、南华生物...
15:56
据鼓狮财经9月17日消息,希荻微(688173.SH)发布公告称,公司已收到法院立案通知。NamDavidIngyun因劳动争议向公司提起诉讼,索赔金额达4844.06万元。NamDavidIngyun主张公司行使其持有的325.76万股股票期权,或赔偿相应的行权损失。希荻微对此回应称将积极应诉。目前案件尚未开庭,预计对公司损益的具体影响尚存在不确定性。
15:56
鼓狮财经9月17日电,福建高速(600033.SH)公告称,公司控股股东省高速集团拟自公告披露之日起12个月内,通过上交所系统以集中竞价方式增持公司A股股份,增持总金额不低于1.3亿元(含),不超过2.3亿元,且增持比例不超过公司总股本的2%。增持资金来源为兴业银行福州分行提供的不超过2亿元专项贷款及自有资金。本次增持不设定价格区间,不触及要约收购,不会导致...
15:56
9月17日,鼓狮财经援引中国瑞林公告称,公司已与KONKOLACOPPERMINES PLC签署赞比亚7万吨/年新建铜尾矿浸出厂项目合同。合同总金额约为4.98亿美元,折合人民币33.78亿元。该合同属于附生效条件协议,目前尚未正式生效,需满足双方签字盖章满28天或公司收到预付款等条件方可生效。若合同顺利执行,预计将对公司经营业绩产生积极影响。不过,项目实施...
15:56
据鼓狮财经9月17日消息,美国空军全球打击司令部司令斯蒂芬·戴维斯上将近日透露,严重的零部件短缺正导致B-52轰炸机的战备状态急剧下降。戴维斯解释称,目前约有17架轰炸机积压在维修厂,甚至不得不拆解新运抵的飞机来获取所需零件。他提到,各基地也面临类似困境,部分飞机多年来一直充当“零部件捐赠者”的角色。戴维斯强调,造成这一局面的根本原因在于供应危机。