2026年7月9日,OpenAI正式向全球用户全面开放GPT-5.6全系列模型。这三款模型分别被命名为旗舰版Sol、均衡版Terra和轻量版Luna。

在这场信息量巨大的发布中,绝大多数人的注意力被两件事吸走。第 一件事是Sol在编程基准测试Terminal-Bench 2.1中狂揽91.9%的得分,将Anthropic的Claude Fable 5甩开超过8个百分点。第二件事是价格腰斩,Luna的输入价格低至每百万token仅1美元,直接掀翻了硅谷的定价体系。

但在技术圈的最深处,真正引发地震的是一句被大多数人忽略的轻描淡写。

OpenAI在技术文档中提到,全家桶里最小的Luna是由老大哥Sol自主完成后训练的。具体而言,Sol自己寻找可用GPU、确定训练配置、编写启动脚本并确认任务执行,全程无需人类工程师干预。

这句话的含金量远超所有跑分和评测。

它意味着过去必须由人类研究员主导的数据清洗、奖励模型设计、知识蒸馏和超参搜索,现在可以由旗舰模型自己独立完成。AI不再只是人类手里的工具,它开始自己带徒弟了。

在AI安全领域,这个概念有一个令人不安的学名,叫做递归自我改进。当AI强大到能够自主重构、测试甚至微调自己的下一代模型时,那个被未来学家预言了数十年的飞轮,终于开始转动了。

这不是一次常规的版本迭代。这是一次范式转移的公开宣告。

什么是AI训练AI

要理解递归自我改进的颠覆性,必须先理解大模型训练的传统模式。

在GPT-4和GPT-5的时代,训练一个顶 级大模型本质上是一个高度依赖人类智慧的手工作坊。

整个流程大致如下。首先,人类研究员要从互联网上筛选和清洗数万亿token的训练数据。然后设计预训练架构,调整数千个超参数。接着通过基于人类反馈的强化学习让模型对齐人类偏好,这一步需要成千上万的人类标注员给模型的回答打分。最后还要设计各种评测基准,反复调试,确保模型不会变傻或失控。

在这个链条中,AI只是被训练的客体,人类研究员是绝 对的主体。模型能力的每一次跃升,背后都是数百名顶 尖博士数月甚至数年的心血。人力成本在整体训练成本中的占比高达30%至40%。

这种模式的瓶颈显而易见。人类研究员的精力、判断力和创造力,成了模型进化的天花板。

GPT-5.6的递归自我改进模式彻底改写了这个链条。

据OpenAI披露的技术细节,在训练Luna的过程中,旗舰模型Sol扮演了自动化研究员的角色。它不再只是被动接受人类喂养的数据和参数,而是主动参与了四个核心环节。

第 一个环节是自主数据筛选。Sol能够自主评估海量候选数据的质量、多样性和潜在偏见,决定哪些数据应该进入Luna的训练集,哪些应该被剔除。这过去需要一个十几人的数据团队干上几个月。

第二个环节是自主实验设计与执行。Sol能自己提出训练策略假设,设计对照实验,在集群上跑通完整的训练流程,并分析实验结果。过去一个初级研究员一天能跑两三个实验就已经是极限,现在Sol一天可以并行跑数百个。

第三个环节是自主知识蒸馏。Luna作为轻量版模型,需要从Sol身上继承核心能力同时压缩参数规模。这个教与学的过程由Sol自己担任老师。它自己决定哪些知识最重要、如何压缩、如何验证压缩后的效果。

第四个环节是自主评测与迭代。Sol能自己编写评测用例,发现Luna的弱点,然后调整训练策略重新来过,形成一个完整的闭环。

OpenAI公布了一组耐人寻味的内部数据。过去半年,公司内部用于代码推理的计算资源增长了100倍,用于智能体任务的token消耗量增长了约22倍。在一套衡量递归自我改进能力的内部评测上,Sol比上一代GPT-5.5高出了16.2分。

当Sol以智能体的形式在代码仓库里自主调试训练脚本、在评测平台上自主分析结果时,它消耗的推理算力和token量自然是人类手动操作的数十倍乃至上百倍。

一位前OpenAI研究员在匿名采访中这样形容。以前我们是在训练一个学生,现在我们是在训练一个助教。这个助教不知疲倦、不需要薪水、不会犯低级错误,而且它学到的每一招都能立刻教给下一个学生。

友商还跟得上吗

当OpenAI把递归自我改进从实验室概念变成工程化量产的工具时,它的竞争对手们处于什么位置?

Anthropic是OpenAI最强劲的对手。就在GPT-5.6发布的前几天,Anthropic的Claude Fable 5刚刚在编程基准测试中当了17天的世界第 一,随后被Sol一夜拉下王座。

但Anthropic的真正危机不在于某一次跑分的输赢,而在于其递归自我改进布局的相对滞后。

Anthropic的核心战略一直是安全优先的精品路线,在模型发布前进行极其严格的安全对齐和红队测试。这种策略在赢得企业客户信任方面非常有效,但在自我改进竞赛中却可能成为拖累。因为递归自我改进的本质是让AI自主行动,而Anthropic的安全哲学恰恰是尽可能限制AI的自主性。

不过Anthropic并非没有意识到这个问题。就在GPT-5.6发布的同一天,Anthropic联合创始人公开宣布了一个震动行业的决定,不再招聘初级工程师。他的原话是,过去需要一大群初级研究员做的大规模实验,现在Claude自己就能完成。公司现在的招聘标准是资深直觉,只招经验丰富、能做方向性判断的人,不再招执行层。

这个决定本身就是对递归自我改进时代来临的最直接确认。当Anthropic开始用Claude替代初级研究员做实验时,它实际上已经踏上了这条跑道。只是它的起步比OpenAI晚了至少半年。

Google DeepMind拥有全球最充裕的AI研发算力和最深厚的研究积累。2025年5月,DeepMind就发布了AlphaEvolve,利用Gemini模型生成候选算法,通过自动评估和演化搜索筛选更优方案,并将这一方法应用于数据中心调度、芯片设计和AI训练流程优化。

但DeepMind的问题在于大公司的官僚流程。每一项新技术从实验室走向产品,都要经过层层审批、安全审查和跨部门协调。当OpenAI的Sol已经在生产环境中以每天迭代的速度训练Luna时,DeepMind的相关项目可能还在等待下一次季度评审。

2026年3月,DeepMind推出了AutoML-X项目,试图建立全自动化的模型训练流水线。但据内部人士透露,该项目至今仍处于有限实验阶段,远未达到OpenAI的工程化量产水平。

对于中国的大模型公司来说,递归自我改进时代的到来可能意味着一场更为残酷的降维打击。

首先是算力瓶颈。这种模式的核心是用推理算力换研发效率,让旗舰模型以智能体的形式24小时不间断地跑实验、写代码、做评测。OpenAI内部代码推理算力半年涨100倍的背后,是其坐拥数万张顶 级芯片的算力底座。而国内公司受制于芯片禁令,算力储备本就捉襟见肘,很难支撑如此奢侈的AI研究AI模式。

其次是布局的代差。当OpenAI和Anthropic已经在用旗舰模型训练下一代轻量模型时,国内多数公司的主力模型还在追赶GPT-4级别的基础能力。这是一个强者愈强的飞轮。你的旗舰模型越强,它训练出的子模型就越好。子模型越好,反过来又能加速旗舰模型的迭代。一旦飞轮转起来,落后者面临的不是线性差距,而是指数级拉大。

一位国内头部大模型公司的技术负责人在匿名采访中坦言,我们现在还在用人力堆的方式追赶他们的上一代模型,而他们已经开始用AI训练下一代了。这就像我们在手工缝制衣服,他们已经上了全自动流水线。差距只会越来越大。

人类研究员的黄昏

递归自我改进的工程化落地,最 先冲击的不是竞争对手,而是AI行业自己的从业者。

在过去三年里,大模型行业催生了大量被称为调参侠的初级研究员岗位。他们的日常工作是清洗数据、跑消融实验、调整学习率、记录实验结果。这些工作重复性高、创造性低,但却是模型训练不可或缺的基础环节。

现在这些工作正在被自动化系统批量替代。

Anthropic联合创始人的那句不再招初级工程师不是预言,而是正在发生的事实。据斯坦福的研究数据,到2025年中,美国22至25岁软件开发者就业人数比2022年的高点下降了将近20%。2026年前两个月,全球科技行业裁员超15万人,AI连续三个月成为裁员首要原因,日均974人丢掉饭碗。

美国国家经济研究局对750家企业首席财务官的调研显示,2026年AI驱动的裁员将达到约50万个岗位,是2025年的9倍。在中国,情况同样严峻。腾讯、阿里、字节等大厂的裁员比例普遍在15%至40%之间,入门级和中等技能岗位首当其冲。

一位曾在某头部AI公司担任初级研究员的工程师在匿名采访中回忆,2025年初他入职时组里有12个初级研究员,每天的工作就是手动跑实验、调参数、写实验报告。到了2026年初,公司上了一套自动化实验平台,底层就是用自己家的模型来跑实验。三个月后,12个人裁到了4个。留下的4个是能做方向性判断和系统架构的。

他苦笑着说,我们花了两年时间训练AI,最后AI把我们训练出了公司。

与初级岗位大面积萎缩形成鲜明对比的,是顶 尖AI人才的超级溢价。

据脉脉2026年1至4月数据,AI科学家和负责人的平均月薪已达13.28万元,是第二名算法研究员7.44万元的1.8倍。OpenAI为了招聘一名研究AI如何安全地训练出更强自己的安全专家,开出了最高44.5万美元的年薪,折合人民币超过320万元。

逻辑很简单。当自动化系统能够替代80%的基础研究工作时,剩下20%的工作变得前所未有的重要。这些工作包括定义研究方向、设计系统本身、判断AI产出是否靠谱。它们需要的是资深直觉和研究品味,是机器短期内无法复制的人类智慧。

AI行业的人才结构正在从金字塔型急剧重塑为哑铃型。底部的大量初级岗位被AI替代,顶部的少量资深岗位薪资暴涨,中间层被严重压缩。

当然,技术变革也在催生全新的岗位。AI训练师不再是给模型的回答打分的标注员,而是设计训练策略、定义AI助教行为边界的高级角色。

对齐工程师的需求正在爆发。当AI开始自己训练AI时,确保训练过程不偏离人类意图、不产生对齐失温变得至关重要。这是AI安全领域最前沿的岗位。

智能体架构师则负责设计多智能体协作框架,让多个AI研究员能够分工协作、互相验证,而不是各自为战。

但问题在于这些新岗位的门槛极高,远非被裁掉的初级研究员能够轻易转型。一场结构性的人才断层正在AI行业内部悄然形成。

终局推演

递归自我改进的飞轮已经转动。它会把AI行业带向何方?

在未来一到两年内,自动化训练系统将成为所有头部大模型公司的标配能力。没有这套系统的公司就像没有自动化流水线的工厂,将在迭代速度上被彻底碾压。

OpenAI的Project Loop项目已投入5亿美元,计划在2027年前实现模型的完全自动迭代。Anthropic和Google DeepMind也在加速追赶。而国内公司受制于算力和人才瓶颈,大概率将在这场竞赛中掉队。中 美AI的差距可能从目前的半年到一年拉大到两到三年。

在中期内,自动化系统将接管大模型训练中50%以上的工作。研发团队将大幅缩编,但人均产出提升5至10倍。一个由10名顶 尖研究员加上一套自动化系统组成的团队,将能够产出今天需要100人团队才能完成的模型。

这意味着AI公司的组织结构将发生根本性变化,从劳动密集型研发转向资本密集型研发。算力投入和系统的质量将取代研究员人数,成为决定模型能力的核心变量。

这是AI安全领域的终 极问题。当系统强大到能够自主设计下一代系统时,就会形成一个真正的闭环。AI设计更好的AI,更好的AI设计更好的训练系统,更好的训练系统设计更好的AI。

如果这个闭环的迭代速度超过了人类理解和干预的能力,就可能触发所谓的智能爆炸。AI能力在极短时间内呈指数级增长,远超人类的控制范围。

Anthropic将递归自我改进分为三个阶段。第 一阶段是AI辅助编码,这是当前阶段。第二阶段是AI自主执行实验,行业正在进入。第三阶段是AI完全自主迭代,尚未到来。

目前行业正处于从第 一阶段向第二阶段过渡的关键窗口期。好消息是这个模式仍然面临几个关键瓶颈。

算力约束是第 一个瓶颈。每一次自我迭代都需要消耗海量推理算力,算力成本可能成为限制飞轮转速的物理天花板。

对齐失温是第二个瓶颈。当AI训练AI时,每一代模型都可能引入微小的对齐偏差。如果偏差在多代迭代中累积放大,就可能导致最终的模型偏离人类的初衷。

研究品味缺失是第三个瓶颈。AI擅长执行明确的实验,但在提出真正原创性的研究假设、做出反直觉的方向性判断方面,仍然远逊于顶 尖的人类研究员。

这些瓶颈为人类保留了一个宝贵的干预窗口。但这个窗口正在缩小。

结语

2026年7月9日,当GPT-5.6的发布页面在全球数以百万计的屏幕上刷新时,大多数人看到的是更强的跑分、更低的价格、更好用的AI工具。

但只有极少数人注意到了那个真正具有历史意义的细节。Luna是Sol训练出来的。

在科幻作品中,奇点往往被描绘为一声惊天动地的巨响。机器觉醒、人类沦陷、世界重构。但现实中的技术奇点往往是一句轻描淡写的宣告,隐藏在一页无人细读的技术文档里。

它宣告的是人类研究员从教练变成裁判的时刻已经到了。过去三年,AI行业的叙事主线是人类训练AI。我们用更多的数据、更大的算力、更精巧的算法,把一个又一个模型推上了智能的高峰。

但从今天开始,叙事的主线正在悄然转向AI训练AI。飞轮已经转动,而人类能做的,是在飞轮转速失控之前,确保自己仍然握着刹车。

奇点不是一声巨响。它是一句轻描淡写的话,而你差点错过了它。

最新快讯

2026年08月29日

16:37
磷化铟作为Ⅲ‑Ⅴ族核心化合物半导体材料,是支撑5G/6G、AI算力、激光雷达、卫星通信的关键基材,当前全球市场需求快速扩张,但高端衬底长期被海外垄断,面临技术管制,国产替代紧迫性突出。 日前,武汉天源完成对中讯半导体(江苏)有限公司60%股权的收购,正式切入磷化铟半导体材料业务。公司原主业为环保的武汉天源,正转型为“环保+能源”综合集团。此举是其向算力、半导...
16:36
周二,英维克一字涨停,这家液冷产业追逐者所信奉的龙头公司,因为产业预期和概念加持,在过去两年涨幅累积近三倍。然而,估值和基本面互相赛跑,一旦跑的太快也就意味沉重的调整。英维克上半年归母净利,下滑14.32%,7月份回撤最多时距离93.52元(前复权)的高点跌去51%。随着Vera Rubin的放量交付,液冷从0到1顺势加速。同一条液冷产业链,一边三家台系厂7...
16:36
近期海外AI安全圈爆出一则极具警示意义的测评事件。8月26日,OpenAI发布了38页事故技术报告,还原了7月那起智能体越权事件。需要说清楚的是,事故的起点确实在受控评测环境,但智能体随后突破隔离、接通公网,并实际攻陷了Hugging Face的生产服务器。更值得琢磨的是它的组织方式。METR与Redwood Research的独立调查显示,约1200个本应...
15:01
鼓狮财经8月29日电,据美国“动力”网站“战区”频道8月28日报道,美军正计划对位于西班牙的莫龙空军基地进行改造,包括新建停机坪,以容纳额外9架绰号“同温层堡垒”的B-52战略轰炸机。此外,五角大楼正重新审视其在欧洲的军事部署,其中可能包括重大基地调整。报道称,此次改造属于美国在西班牙罗塔地区一项近5亿美元设施建设项目的组成部分,这些设施为美国在欧洲、非洲和...
15:00
工程机械行业正步入新一轮增长周期。随着国内上一轮高峰投放的设备陆续进入更新窗口期,叠加政策刺激,替换需求持续释放。与此同时,海外市场持续扩容,中国企业凭借供应链优势、智能制造能力及新能源技术,正加速抢占全球市场份额。矿山装备、机器人等新兴领域也不断开辟新的增量空间,使得行业增长不再单纯依赖地产或基建周期,全球化与多元化成为新的增长引擎。中联重科便是这一趋势下...
14:28
鼓狮财经8月29日讯 OpenAI首席执行官萨姆·阿尔特曼与埃隆·马斯克之间的矛盾再次激化。美东时间周五,OpenAI宣布将停止向代码工具Cursor提供AI模型服务,而Cursor目前隶属于马斯克旗下的SpaceX。 这一决定发生在SpaceX于6月宣布以600亿美元全股票交易收购Cursor母公司Anysphere,并于本月初完成收购之后。OpenAI随...
14:28
8月29日,长鑫存储宣布新一代LPDDR6内存正式量产,并首发搭载于小米18Fold旗舰折叠屏手机。对此,雷军在微博发文盛赞:“祝贺长鑫实现LPDDR6内存量产,非常了不起!玄戒O3是首款支持长鑫LPDDR6的芯片,小米18Fold也首发搭载了该内存。我相信这只是开始,未来会有更多优秀的中国科技企业强强联合,勇攀高峰!” 值得注意的是,就在本周,小米集团也宣...
14:28
今年财政节奏明显放缓。这一现象主要体现为支出进度缓慢和发债进度滞后。 首先,财政支出增速远低于收入增速。今年前7个月,财政支出同比增长1.3%,而同期财政收入增长5.8%,导致财政赤字仅为1.9万亿元,显著低于去年同期的2.5万亿元,赤字落地进度明显慢于往年。其次,专项债发行进度显著低于往年。截至本周,2026年新增专项债累计发行2.88万亿元,发行进度为6...
13:58
鼓狮财经8月29日讯,山西焦煤在业绩说明会上透露,近期公司主要涉及的停产矿井包括西曲矿、马兰矿、镇城底矿及西铭矿。 在具体停复产时间上,西曲矿经历了多次波动:该矿于7月23日停产,7月30日复产,8月5日再次因事故停产,直至8月26日才恢复生产。马兰矿于7月27日停产,随后在7月30日恢复生产。至于镇城底矿和西铭矿,则分别于7月27日和7月30日停产,此次停...
13:26
每一轮产业革命,都会重写资本的流向,也会重排金融机构的座次。2026年的全球资本市场,处在两股力量的拉扯中:股债震荡与宏观不确定性压制风险偏好,AI、具身智能、半导体和先进制造却继续催生融资、并购与产业整合需求。资本并未离场,只是变得更加挑剔:既要看懂技术浪潮,也要找到能够把产业机会转化为真实交易和持续回报的平台。这恰恰是华兴资本重新显露锋芒的时刻的到来。凭...
13:26
近日,英伟达Spectrum-X Ethernet Photonics CPO交换芯片宣布全面量产,首批产品交付CoreWeave、Lambda Labs与甲骨文,成为全球首款实现规模化商用的200G/lane CPO交换机系统。这一节点的意义远不止一款产品落地,它标志着CPO(共封装光学)正式走出实验室,从行业远期路线图变成了AI数据中心的现实选型。几乎同...
12:22
鼓狮财经8月29日电,据媒体报道,空客正探索出售旗下美国航天业务,同时计划通过三方合并,打造一家泛欧洲卫星龙头企业。知情人士透露,空客正在评估潜在收购方对其美国航天业务的收购意向。空客美国航天系统业务包含佛罗里达州一处工厂,以及“箭”系列小型卫星。该系列卫星可实现规模化量产,面向商业及政府通信、对地成像业务,也可满足国家安全相关需求。针对“市场传闻与猜测”,...