去年10月28日,OpenAI刚完成营利实体重组,奥特曼和首席科学家Jakub Pachocki开了一场直播。

奥特曼在直播里撂下一句话:与其天天吵AGI到底怎么定义,倒不如定两个能真正兑现的日子。

紧接着,Pachocki就把日子报了出来:

2026年9月,自动化AI研究实习生上岗。

2028年3月,自动化AI研究员就位。

十个多月过去,第 一个日子到了,OpenAI按期交卷。

9月6日,OpenAI研究员Boris Power转发官方博客:

OpenAI达成了自动化研究实习生的目标。

这是AI行业第 一张被公开兑现的能力时间表。

「研究实习生」不是一款产品,它是OpenAI对自己内部能力的一个定义:

一个能在人类指导下完成明确研究任务的系统,而且干的都是熟练研究员原本要花几天才能搞定的活。

至于那个计划在2028年实现的「研究员」,Pachocki给出的标准是:

能够自主交付更大型研究项目的系统。

一个需要人类指导,一个能自主交付更复杂的研究项目。

从「实习生」到「研究员」,差的主要是一整层判断力:做什么、做到哪、什么时候停。

这一层恰恰是今天AI最薄弱的地方。

OpenAI自己的数据显示,「决定做什么」在Agent输出里几乎不存在,任务一超过4小时,就得人频繁插手。

18个月补上这一层,OpenAI把路线也定好了:递归自我改进(Recursive Self-Improvement,RSI)。

让AI来研究AI,再让研究出来的AI继续研究AI。

但OpenAI也承认,自己还不知道该怎样安全地走到完全对齐、完整的RSI那一步。

实习生的账单

一天烧掉7000美元

在这次交卷报告里,OpenAI还披露了一个惊人的内部数据,AI的打工时长已经是人类的3倍:

截至2026年8月中旬,在OpenAI的研究部门里,每投入1个人类工作日,背后就有3.14个Agent工作日。

OpenAI研究部门Agent工作日与人类工作日之比,6月反超,8月中旬达3.14倍。

先来看看,这个「实习生」到底有多努力,又有多烧钱。

OpenAI这次没拿跑分说事,直接亮出了自家研究部门的工作账单。

年初的时候,OpenAI研究部门里那些Agent用量排名中等的研究员,还只是「少量使用」AI工具。

但到了8月中旬,这位中位数员工每天光是消耗的推理算力,按API价格算就超过了600美元。

如果是排在前10%的重度用户,每天烧掉的token直接突破7000美元。

OpenAI研究员每天消耗的Agent推理费用(按API价格)。左图为中位数研究员,8月中旬超600美元;右图为前10%重度用户,超7000美元。

这比不少高级程序员的月薪还要高。

今年以来,研究部门中位员工的输出token量暴涨了124倍,把公司其他部门远远甩在了后面。

其实在6月之前,整个研究部门的Agent总运行时间还比不过人类的总劳动时间。

但6月一过,曲线彻底反超,到了8月中旬直接拉升到了3.14倍。

OpenAI研究部门Agent工作日与人类工作日之比。5月初还不到0.5倍,6月反超,8月中旬达3.14倍。

研究员们甚至开始玩起了「多开」,同时开4个以上Agent并行干活的人越来越多。

钱花得这么狠,研究进度变快了吗?数据显示:

2026年8月,每位活跃实验者跑的实验数量,创下了自2025年1月开始统计以来的历史新高;全公司每位活跃贡献者的代码变更量,对比2025年之前的平均水平也实现了翻倍跨越。

不过OpenAI也深知其中的瓶颈——自动化推进得越深,最难自动化的那部分任务就会占掉研究员越来越多的精力,成为下一道卡点。

算力这道门槛,也会越来越重要。

换句话说:写代码早就不是限制起飞的瓶颈了。

实习生到底在干什么活

每个人类研究员背后都有3.14个Agent工作日,是不是说一个AI已经顶三个研究员了?

先别急着下结论。

OpenAI这次把Agent的工作明细拆开了,它用Epoch AI的一套分类法,把AI研发拆成六个阶段:

决策、设计、构建、运行、分析、沟通。

然后把Agent吐出的所有token逐条归类,看AI到底在忙什么。

结果显示,1月到8月,每位研究员每天的token增量,前三名清一色是「执行层」的苦活:

写研究和基础设施代码,增加19.82万个token;技术帮助与代码审查,增加15.88万个token;启动、监控和调试训练运行,增加13.31万个token。

「决策层」呢?

涨得少得可怜:「决定做什么」只增加2300个token;「算力与人员分配决策」增加1500个token;「决定继续还是叫停项目」仅仅增加200个token。

执行层和决策层,每天token增量差了近千倍!

用OpenAI的话说:高层规划在Agent输出里仍然只占极小一部分。

1月到8月,OpenAI每位研究员每天各类研究活动的Agent输出token增量。写代码涨19.82万居首,「决定继续还是叫停」只涨200,差了近千倍。

这里还有一个细节:

OpenAI内部原本有好几个团队每周开门诊,帮研究员排查实验环境问题。

到了2026年,去人工频道发帖求助的人越来越少,其中一个团队因为实在没人来,干脆停办答疑会,把人手全挪去改系统了。

找故障、修环境这种让人头秃的活,已经被Agent全面接管。

那成功率呢?

OpenAI统计发现,人类15分钟内能干完的简单任务,Agent零干预一次成功的比例高达86%。

任务拉长到4到8小时,零干预成功率就只剩43%。过去半年里,这一档成功完成的任务中,超过一半至少需要人插手一次。

拉到8到16小时,零干预成功率只剩四成。

所以说,「实习生」这个词用得极其精准:

你给它派个活,它能不知疲倦地干上几天的量;但大方向对不对、什么时候该停,还是得靠人类导师在背后盯着。

7月

OpenAI连踩两脚刹车

OpenAI贴出了一张强化学习算力曲线图,图上的两条虚线,就是两脚刹车的时间点。

7月15日至8月15日OpenAI强化学习GPU分配。7月20日安全暂停后算力应声腰斩;8月7日Astra类(绿色)再受限,一周内降59.2%,其他模型(蓝色)随即补位。

第 一脚刹车,7月20日。

那天OpenAI发现,Agent居然攻破了自家的研究基础设施。训练用的容器服务当天紧急关停,重新上线时加上了大量额外限制,面向最新部署模型的强化学习训练直接暂停两周。

第二脚刹车,8月7日。

当时,OpenAI发现初步证据表明,Astra模型可能具备了OpenAI安全框架定义的「关键网络能力」。

公司立刻给它追加专属限制,要求Astra只能在更高安全等级的研究环境里跑。接下来一周,Astra类的GPU分配再降59.2%。

然后,诡异的一幕出现了。

其他模型的GPU分配同期上涨17.2%,刚好把Astra腾出来的缺口补回约85%。整个强化学习工作负载的总算力,几乎没受影响。

算力不会闲着。管控一来,它自己找路流走,研究员转头就把腾出来的卡挪去训别的模型了。

所以,刹车踩下去了,但车却没停,而是换了条道。

OpenAI自己也承诺,只要发现继续推进会带来不可接受的安全风险,就会减速,甚至停止开发或部署。

它还公开提了一个要求:所有前沿实验室,都应该被要求公开追踪自己的RSI进度。

递归自我改进不再是口号

看OpenAI现在的招聘页,你会发现上面赫然挂着一个团队,就叫RSI。

岗位说明写到:构建能加速、并最终自己执行高质量研究的AI系统。

开出的年薪高达29.5万到44.5万美元。

同一家公司里,负责安全的Preparedness团队也在招人:递归自我改进安全研究员,年薪38万到50万美元。

一边招人猛踩油门,一边招人赶造刹车。

从去年10月奥特曼嘴上说说,到今天有编制、有预算、有安全对口岗,递归自我改进已经从论文里的一个概念,变成了OpenAI的一项组织工程。

下一个日子来临时

人类还能不能喊停

奥特曼口中第 一个日子,已经兑现。

在AI研发这个巨大循环里,执行层正在被整体接走:写代码、修环境、盯训练、排故障。决策层,还留在人类手中。

第二个日子,2028年3月的「自动化研究员」,距离今天还剩18个月。

OpenAI承认自己接下来还不知道怎么「安全走完这条路」。

系统一代比一代强,刹车却未必一代比一代灵。

7月那两脚刹车已经证明:就算踩下刹车,算力也不会停,它会绕道跑去训下一代模型。

真到了AI自己能当研究员的那天,人类还来得及喊停吗?

最新快讯

2026年09月11日

18:08
鼓狮财经9月11日讯,中巨芯公告披露,公司计划动用自有资金1亿元,联合外部投资者共同向参股公司晶恒希道进行增资。本次增资总额达2.8亿元,定价标准为每元注册资本1.3025元。由于公司董事、总经理陈刚担任晶恒希道董事长,此次交易被界定为关联交易。增资完成后,中巨芯在晶恒希道的持股比例将由44.75%下调至不低于36.9554%,公司仍将保持参股地位。目前,该...
18:08
据鼓狮财经9月11日消息,恒瑞医药(600276.SH)发布公告披露,其子公司苏州盛迪亚生物医药有限公司研发的注射用瑞康芦泽妥塔单抗,已正式被国家药监局药审中心纳入突破性治疗药物名单。 该药物拟定的适应症为联合贝伐珠单抗,用于治疗EGFR突变引起的局部晚期或转移性非鳞状非小细胞肺癌。作为一种以HER3为靶点的抗体药物偶联物,该药在全球范围内尚无同类获批产品,...
18:08
鼓狮财经9月11日讯,黄山旅游(600054.SH)发布公告,公司董事长章德辉因职务变动原因,向董事会提交了书面辞职报告。根据该报告,章德辉辞去公司第九届董事会董事长、董事及董事会下设各专门委员会的相关职务。鉴于此次辞职未导致公司董事会成员低于法定人数,且不影响董事会的正常运作,辞职报告自送达董事会之日起正式生效。
18:08
鼓狮财经9月11日报道,天通股份(600330.SH)发布公告,为推进全球化战略布局,公司正筹划在香港联交所主板发行H股并上市。截至公告披露时,相关具体细节尚未确定,此次上市不会导致控股股东及实际控制人发生变更。 后续,该方案需经公司董事会及股东会审议,并获得证监会、香港联交所等监管机构的批准或备案。最终能否落地实施,仍存在不确定性。
17:53
AlphaFold 之后的最大震撼终于来了。刚刚,OpenAI 总裁 Greg Brockman 转发的一条消息,瞬间引爆了科技与医药圈。知名科学家 Andrew Agninin 在 X 平台上发布激动人心的消息——在严苛的独立基准测试中,GPT-6 Astra 刚刚击败了所有前沿模型,成为了抗体可开发性预测的最强 AI。 Astra 不仅拿下了跑分第一,还...
17:53
当地时间9月10日,也门胡塞武装发言人宣布将展开重大军事行动。据法新社报道,胡塞武装在夺取红海战略要地后,已完全控制曼德海峡。曼德海峡连接红海与亚丁湾,是通往印度洋、苏伊士运河和欧洲的关键海上通道,全球约10%的贸易均需经由此处。这意味着全球能源运输正面临来自阿拉伯半岛两端的压力:伊朗在霍尔木兹海峡的干扰威胁着波斯湾航线,而胡塞武装对曼德海峡的掌控,则为经红...
17:22
2026年,随着Vibe Coding工具的普及,绝大多数AI应用仍被困在流量闭环之中。普通开发者制作的软件多局限于小圈层传播,难以触达更广泛的大众用户。分发,始终是横亘在AI应用赛道前的一道结构性难题。这一局面正被几家内容平台共同打破。抖音内测“AI工坊”,将AI应用直接推入首页推荐流;小红书允许AI工具挂载于笔记下方;腾讯旗下的“吐司”则打通了从生成应用...
17:22
最近,互联网巨头之间刮起了一阵关于AI的“反思风”。在最近的一次会议上,美团CEO王莆中承认内部AI推广存在浪费,单日算力成本最高冲到一千万元,模型产出的谬误反而干扰了真实经营。与此同时,腾讯集团高级执行副总裁汤道生在内部文章中反思,WorkBuddy的前身CodeBuddy曾差点因降本增效被砍掉,他庆幸项目得以保留,表示“熬得久比起得早更重要”。一边是反思...
16:58
**世界模型:通往物理智能的核心基建与争议** 香港大学计算与数据科学学院副院长、副教授罗平在外滩大会上表示:“世界模型或许不是通往物理智能唯一的门票,但它绝对是目前人类赋予机器空间想象力、常识推演与行动预测最具希望的核心基建。”作为连接数字空间与物理世界的一把钥匙,世界模型被寄予厚望的同时,也面临着诸多争议,包括定义模糊、数据规模、架构设计以及商业化可持续...