在过去几个月里,OpenAI和Anthropic轮番推出了各自的旗舰模型,而谷歌显得格外安静。尽管Gemini Flash系列几乎每三周就更新一次,从3.6到3.8连续迭代,但代表最高能力的Pro版本却迟迟未见动静。直到最近,大模型竞技场Arena里突然出现了一个名为“gemini-3.8-flash”的模型。开发者上手后发现,其表现明显超越了正式发布的3.8 Flash,在代码编写、SVG生成和Agent任务上更是突飞猛进。随着几轮实测的深入,一个猜测在社区迅速扩散:这很可能是谷歌隐藏在标签背后的下一代旗舰——Gemini 4 Pro。与此同时,一张夸张的基准测试对比图也开始疯传,显示该模型在编码、Agent和推理等各项任务上都超越了GPT-6 Astra和Claude Fable。就在几天前,几大重要AI公司还在公开讨论是否应该放缓研发节奏,而如今,减速的呼声尚未落地,新一轮竞赛已然狂飙。而在这个疑似Gemini 4 Pro的“神级模型”背后,一个更关键的关键词浮出水面:RSI。
9月2日,谷歌正式发布了Gemini 3.8 Flash,称其为系列最新一代,在软件工程、Agent任务和多步推理上有显著提升。然而,当Arena中再次出现一个同名的模型时,开发者敏锐地察觉到了异样。真正的3.8 Flash已有参照物,而这个模型的表现明显更强,显然是Pro级别的实力。早期传播的实测主要集中在SVG、网页和3D场景上。开发者Harshith让该模型绘制侧视家猫,并与GPT-6 Astra Max及正式版3.8 Flash对比,发现Arena中的版本在轮廓、比例和细节完整度上均有肉眼可见的差距。X网友@thtbee_从多个角度连续测试了疑似Gemini 4 Pro的模型:一个Voxel风格宝塔,模型耗时8分钟生成整套可交互3D场景;一架空客H145直升机,约10分钟搭出完整3D展示页面,细节丰富但底部UI略显粗糙;网页设计上,约14分钟完成单色主题网站,整体干净完整,似乎补上了过去Gemini被诟病的品味问题。另一位网友@Mr_Salio则用该模型制作游戏,成品画面流畅,世界生成和设计完成度很高。更关键的线索来自开发者Qwinah,他声称成功“幽灵路由”到了Gemini 4 Pro的后端,并贴出疑似内部终端截图。根据他的描述,该模型的内部标识包含G4P-ARGON和VIA_3.8_FLASH,最大输出容量达256K,上下文窗口超过1000万token,具备跨会话永久记忆、无需API联网、后端自动编译运行脚本以及物理机器人控制等能力。若属实,这绝非普通Flash升级。
与此同时,一张Gemini 4 Pro的基准测试对比表开始在社区疯传。数据显示,该模型在软件工程测试DeepSWE v1.1中达到88.7%,终端Agent测试Terminal-Bench 2.1为95.3%,专家级知识推理HLE-Verified为72.1%,电脑操作Agent测试OSWorld 2.0为86.8%。更夸张的是,在衡量真实知识工作的GDPval-AA v2上,其Elo评分突破2000,被形容为“拳打Fable,脚踢Astra”。然而,越是夸张的数据越需谨慎。值得注意的是,这张基准表与Qwinah“挖”出的后端截图并不完全吻合,基准表中作为对照项的Astra得分也不符合官方数据,且两份材料均无Google或Arena官方背书。目前唯一能确认的是那个名为gemini-3.8-flash的模型,以及其完全不符合3.8 Flash水平的表现。大家之所以迅速指向Gemini 4 Pro,是因为谷歌的Pro系列已经空窗太久。Gemini 3.5 Pro迟迟未发,4 Pro已确认在训练中,Flash一代代推,Pro线却无新模型。因此,一个异常强大的“3.8 Flash”出现,便自然让人联想到谷歌直接憋到了4 Pro。
在疑似Gemini 4 Pro的传闻背后,更大的关键词是RSI。RSI全称为Recursive Self-Improvement,即递归自我改进,指AI开始参与制造更强的AI,从而加速下一代模型的研发。路透社8月披露,谷歌联合创始人Sergey Brin近几个月一直在推动Gemini提速,并将递归自我改进列为重点。虽然谷歌未公开宣布实现闭环,但已将越来越多原属于研究员的工作交给Agent,包括评测、寻找改进方向和跑实验。9月2日发布3.8 Flash时,谷歌官方提到一套长期运行的Agent循环正在“递归地评估和改进底层模型”。Google DeepMind研究员姚顺宇化用阿姆斯特朗登月名言:“这是模型的一小步,RSI的一大步。”最近,谷歌还发布了一篇题为Dream-RSI的论文,研究Agent如何通过改进探索策略实现递归自我改进,在算法工程、数学优化和GPU kernel任务上显示出更高效率。因此,Gemini 4 Pro的传闻才会迅速与RSI绑定,社区追问谷歌内部RSI的进度。RSI并非谷歌独有。9月17日,Anthropic公开内部研发自动化数据,显示Claude已主导26%的AI研发任务(2-3月不到1%),超过90%的任务进入AI协作阶段。国内智谱创始人唐杰也表示:“我们仍远未达到递归自我改进,但最小的循环已经出现:模型优化系统,系统服务模型。”智谱的工程实践中,由GLM-5.3驱动的Infra Agent参与了推理基础设施的设计、调试和优化,在超10万张国产AI芯片集群上,两周内将端到端吞吐提升至初始水平的3.2倍。
就在几天前,阿莫迪呼吁前沿AI公司携手“减速”,并将RSI列为第一个需要警觉的条件。模型进步固然是好事,但若AI参与制造下一代AI,人类理解和控制的速度未必能同步加快。阿莫迪强调,要在能力跨过某些门槛前建立第三方评测、共同安全标准和减速机制,否则一旦RSI形成正反馈,模型可能已越过安全距离。在风险上,几大实验室确实达成了共识。奥特曼认同“放慢节奏”,承诺引入独立评测者;马斯克表示“Dario是对的”;哈萨比斯也称方向正确,但具体做法需讨论。然而,那篇倡议也指出,单独减速没有意义。实验室之间有竞争,国家之间有博弈,任何一家单独放慢都担心让出领先窗口。因此,共识在“应该谨慎”上达成,却在“具体怎么减、谁先减”上迅速消失。实验室表现得言行不一。谷歌疑似已在Arena测试Gemini 4 Pro;Anthropic社区出现Opus 5.2灰度痕迹;OpenAI后台模型列表出现gpt-6-sol标识。根据流传消息,GPT 6 Sol可能在下周或9月29日Dev Day发布。三家实验室的下一轮模型都已露出测试痕迹。这轮“减速倡议”最确定的成果并非任何一家真的减速,而是公开讲了一遍风险。模型并未放缓,但至少未来若出事,他们可以说:我们早就提醒过了。
