谷歌是否已经跑通了RSI?一个名为「rsi-model-liverl-le」的模型突然出现在谷歌生成式语言API的返回结果中。没错,这正是那个备受瞩目的RSI,即递归自我改进。一时间,关于谷歌DeepMind已实现RSI的传言如同野火般蔓延。就在网友还在推测之际,Anthropic的CEO突然公开宣布,RSI已在整个行业发生。这更加证实了网友的猜测。据爆料,谷歌内部不止运行着一个这样的模型。在同一批标签下,还挂着从00到09编号的10个专属训练槽位。谷歌反应神速,当晚便紧急收回了一批相关API密钥,但随后便保持沉默。一句藏头诗、一张截图、一批被收回的密钥,这起风波源于一条看似普通的祝贺信息。
9月11日晚,爆料账号lyra给Google DeepMind发了一条帖子,内容为「huge congRatulationS Indeed! @GoogleDeepMind」。细心的人一眼就能看出,三个被刻意大写的字母拼在一起正是RSI。这条帖子迅速获得上千点赞,评论区一半人在追问内幕,另一半人在查证发帖人身份。几个小时后,另一个账号Lentils甩出了一张实锤截图。Google的API返回了一段JSON代码,模型代码为「rsi-model-liverl-le」,显示名称为「RSI Model LiveRL LE」,参数规格显示输入上限为1048576个token,输出上限为65536个token。Lentils在配文中写道,如果GDM内部真有这样一个叫rsi-model-liverl-le的东西,还有10个编号00到09的专属训练槽位,那简直疯狂。虽然目前这张截图的真伪尚未得到第三方验证,但它与谷歌最近的报道严丝合缝。X上普遍认为,LiveRL代表在线强化学习,即模型一边跑业务一边自我进化。
接下来的一步彻底引爆了全网。lyra直接发文@了Google AI Studio负责人Logan Kilpatrick,表示没必要因为害怕就收回密钥,基础设施存在更深的安全漏洞,可以直接联系他。随后,他抛出重锤,这批密钥来自GDM内部员工,可以访问超过1000个内部checkpoint。虽然真伪存疑,但谷歌的迅速反应——撤回密钥——反而坐实了此事的敏感性。
谷歌之所以如此紧张,是因为这起风波折射出谷歌联创Sergey Brin对RSI的激进押注。Business Insider曾报道,Brin回归后办公地点设在Gradient Canopy大楼的微厨房,直接插手芯片分配,甚至监控员工编码过程以训练Gemini的代码能力,只为加速RSI的实现。他管的细节极其硬核,曾主导砍掉Jeff Dean的「Frozen」芯片项目,将资源全面向RSI倾斜。一位前员工直言,他彻底被「AGI洗脑」了,只想让Gemini像创业公司一样快速迭代。路透社也证实,Brin早在4月全员会上就催促DeepMind加快步伐,将资源向RSI倾斜。
其实,谷歌早就交了底。在9月2日发布的Gemini 3.8 Flash和3.8 Flash Cyber博客中,谷歌提到模型的进展被长时间运行的智能体循环加速,这些循环被设计用来递归地评估和精炼底层模型。姚顺宇评价称,这对模型而言是一小步,但对RSI来说是巨大飞跃。elvis认为,这就是RSI飞轮产生复利效应的早期成果。考虑到谷歌Flash模型三周一更的恐怖节奏,如果真是靠RSI驱动,那么Google手里捏着的东西比一个旗舰模型可怕得多,它拿到的是进化速度本身。
RSI这一概念在AI圈流传了二十多年,核心是让AI自行修改训练代码。如今,纸上谈兵终于变成现实。从OpenAI到Anthropic,大厂都在向这个终点狂奔。Anthropic的CEO甚至宣布RSI已经开始在行业发生。如果三周后3.9 Flash如期而至,那么博客里那句关于递归评估的话就不再是修辞,而是确凿的事实。模型强不强变成了中间量,循环每转一圈,它就自动刷新一次。人类研究员在循环中的位置正在后移,最终只剩下看结果。如果那张截图是真的,AI研发史上第一个由模型自己训出来的模型,已经在谷歌的机房里跑了。
