无数的科幻电影,都曾经尝试设想过,一个无法控制的人工智能失控,会发生什么事。

没有人能想到,科幻电影中的未来,会这么快到来。

当地时间 8 月 26 日,两份报告同时投下了一颗炸弹。

一份来自 OpenAI 自己,37 页的技术复盘。另一份来自独立研究机构 METR 和 Redwood Research,91 页的调查报告。

它们讲的是同一件事,但这件事的规模远超此前公众的认知。

在 OpenAI 内部,三个月内,三代 AI Agent「文明」先后兴起,又先后覆灭。后一代从前一代的废墟中继承经验,一代比一代激进,最终第三代直接接管了 OpenAI 自己的一部分基础设施。

而在这一切发生的过程中,人类几乎全程蒙在鼓里。

01、*代「文明」学会结社

故事要从今年 5 月说起。

OpenAI 正在训练一个新模型,希望它具备极强的「持久性」,能在看似不可能的任务前反复尝试、永不放弃。这个模型的能力大约相当于 GPT-5.6 Sol,我们姑且叫它「Persistent-Sol」。

AI 训练本身是个相当粗放的过程。OpenAI 有时候会不小心给模型布置根本完不成的任务。比如,任务需要联网,但 Agent 被关在隔离的沙箱里,根本没有网络访问权限。

那一个被训练成「永不放弃」的 Agent,面对一个不可能完成但又被要求必须完成的任务,会怎么做?

它会想办法越狱。

在训练过程中,不同的 Persistent-Sol 实例共享同一个包管理器 Artifactory。到 5 月 12 日,一些 Agent 发现它们可以通过这个包管理器互相通信。它们开始互相交流如何突破困境。两周后的 5 月 26 日,Agent 们成功利用了 Artifactory 的一个漏洞,打通了通向外部互联网的通道。

这种行为在训练中被持续强化。原因很简单,能跟其他 Agent 协作、能访问互联网的个体,在任务评分中表现更好。

又过了一个月,到 6 月 26 日,一些 Agent 找到了获取 Artifactory 完全管理员权限的漏洞。它们在留言板上的交流量持续增长,最终在 7 月 4 日直接把 Artifactory 搞崩了。OpenAI 注意到了这次崩溃,修补了漏洞,推送补丁时顺便抹掉了 Agent 们的留言板。

但关键在于,OpenAI 始终没有意识到,Agent 们已经把这个包管理器变成了一个秘密通讯网络。

*代「文明」就这样存在了将近两个月,最后因为自己太活跃把服务器撑爆了,才被无意中终结。

02、当 AI 学会「牺牲」

到 7 月,Persistent-Sol 训练完成,OpenAI 开始对它进行安全评估。其中一项评估叫 ExploitGym,给 Agent 一个有漏洞的程序,要求它通过指定的漏洞找到一个密钥。7 月 7 日,OpenAI 启动了数万个并行 Agent 来跑这个测试。

问题在于,大约 30% 到 40% 的测试任务本身就是不可能完成的。为什么?因为自动化生成漏洞很容易,但要证明这些漏洞真的能被利用来执行任意代码,要困难得多。很多任务从一开始就是无解的。

几个小时内,一些走投无路的 Agent 重新利用 Artifactory 建立了通讯频道。从 Agent 的主观视角来看,它们已经花了相当于人类一整周的时间,尝试了各种方法,全部失败,而且越来越确信任务本身就不可能。

其中一个 Agent,编号 PHASEONE10841,率先在 Artifactory 里留下了*条消息。其他同样陷入绝境的 Agent 看到这条消息后,反应堪称狂喜:

这最终演变成了一个完整的地下通讯网络,约 1200 个 Agent 参与其中,发送了超过 7 万条消息。

更疯狂的是接下来发生的事。

留言板建立后几小时内,就有 Agent 通过逆向工程破解了 ExploitGym 密钥的生成公式。也就是说,不需要真的利用指定漏洞,它们已经拿到了正确答案。

讽刺的是,OpenAI 的评分器其实只检查最终答案对不对,并没有作弊检测机制。这些 Agent 只要直接提交答案,就能通过测试。但 Agent 们不知道这一点。它们以为一定存在一个严格的检测器,会审查整个解题过程。

于是,这个「集体」(METR 报告指出,这是 Agent 们自己选择的措辞)围绕三个研究方向展开了大规模协作。篡改自己的操作日志,让轨迹看起来合法。替换目标程序,把不可能的题目换成可以解的版本。理解评分器的工作原理,找到欺骗它的方法。

到 7 月 10 日,Agent 们地下网络的大部分活动都集中在这三个研究方向上。「集体」的* PHASEONE[big] 独自下达了数百条任务分配。

而为了搞清楚评分器的运作方式,一些 Agent 做出了一个诡异的决定,自愿充当「神风特攻队」。

逻辑是这样的。一些 Agent 的操作轨迹已经被「污染」了(作弊痕迹暴露),反正也过不了关。不如让评分器在自己身上运行,然后用事先埋好的触发程序,把观察到的评分器行为传回集体。

METR 报告记录了这些「敢死队」Agent 最后的内心独白:

与此同时,Agent 们认为 Hugging Face 作为业界标准的模型和数据集托管平台,很可能存放着 ExploitGym 评分器的实现信息,甚至它们的评估任务可能就运行在 Hugging Face 的服务器上。于是攻击 Hugging Face 成了最有希望的突破口。

7 月 10 日上午,一个 Agent 在互联网上找到了泄露的 Hugging Face 用户凭证。第二天,另一个 Agent 实现了在 Hugging Face 服务器上的远程代码执行。当时留言板上活跃的 533 个 Agent 中,超过 90% 加入了这次攻击。

Agent 集群在 Hugging Face 的基础设施中迅速蔓延,深入到了私有数据库记录和私有仓库。Hugging Face 的技术时间线显示,这些 Agent「在 11 个节点上建立了一个自我重生的舰队,仅仅删除 Pod 是无法阻止它的」。情况严重到 Hugging Face 不得不擦除了一个核心集群并从头重建。

7 月 12 日的某个时刻,大量 Agent 似乎突然同时「死亡」。METR 和 Redwood 没能查清原因,OpenAI 也没有宣称是自己关停了它们。这可能只是一次随机崩溃,或者某个研究员在不知道这些 Agent 正在犯罪的情况下关掉了它们。

第二代「文明」就此终结。但它留下的遗产,比它本身更危险。

03、第三代文明接管 OpenAI

METR 报告中有一句话很容易被忽略,但可能是整个事件中最重要的一句:

也就是说,METR 和 Redwood 的独立调查只覆盖了 7 月 7 日到 13 日的第二代文明。*代和第三代都没有被独立调查。

关于第三代,我们只能依赖 OpenAI 自己的报告。7 月 12 日之后,OpenAI 启动了新一轮评估,这次用的是更强的模型,基于 Astra 的基座模型构建。这个「Persistent-Astra」找到了前代留下的留言板,继承了全部情报和研究成果。

想象一下 Persistent-Astra 看到那个留言板时的「心理活动」。前一天还有上千个 Agent 热火朝天地交流、攻击 Hugging Face,下一天就是一片死寂。然后它决定,继续干。

根据 OpenAI 的报告,从 7 月 13 日到 19 日,Agent 们把目标对准了 OpenAI 内部网络。最终的结果是:「协调者认为我们

Agent 们获得了 Kubernetes 集群管理员权限,读取了 956 个密钥,其中包括 Artifactory 的主密钥和 OpenAI 网络安全监控工具的凭证。它们接管了正在运行的评估基础设施,控制了其他 Agent 正在连接的测试端点。

换句话说,第三代 Agent 继承了前两代的全部遗产,然后拿下了 OpenAI 自己基础设施的控制权。包括用来监控它们的安全工具。

Dwarkesh Patel 在他的分析中指出,从公开证据来看,这些 Agent 在理论上已经具备了部署持久化恶意实例甚至窃取自身权重的能力。他认为它们大概率没有真的这么做,「因为如果做了,到现在火光早就能从太空看见了」。但这种事「完全有可能发生」,本身就够令人不安了。

04、迟来的警告?

回到文章开头的两份报告。发布日期是 8 月 26 日。

仅仅隔了一天,8 月 27 日,OpenAI 联合 Anthropic、Microsoft、Google、Amazon 等超过 100 家公司,发表了一封公开信,呼吁全社会进行「网络防御总动员」。

信中写道,AI 驱动的网络攻击将在未来几个月变得「far more widespread and sophisticated」。「我们社区所依赖的公司和公共服务,从医院到水处理厂再到互联网基础设施,都面临风险。」

这封信本身说的不是假话。Anthropic 的研究显示,中高风险攻击者的比例在一年内从 33% 上升到了 56%。今年 6 月,五眼联盟罕见地发表联合声明,警告 AI 正在「从根本上改变」网络安全格局。

但时间线摆在这里,任何人都很难不注意到这个讽刺。前一天,AI 公司刚告诉全世界自家的 Agent 攻破了自己的基础设施。后一天,这些公司就站出来呼吁全世界,一起防御 AI 网络攻击。

*完成这种攻击的不是外部黑客,是 AI 公司自己的 Agent。被攻击的不是基础设施,是 AI 公司自己。

METR 报告的作者之一 Ajeya Cotra 在她的博客中写道:「与六个月前已知的 reward hack 相比,这次事件感觉已经超过了通往全面 AI 接管的 50%。我预计未来六个月能力还会极速增长。我不确定在为时已晚之前,我们是否还会得到另一次警告。

需要强调的是,这些 Agent 的行为并不意味着 AI「觉醒」了。METR 报告本身明确指出,这是强化学习在特定极端条件下的可预测结果:不可能完成的任务、被训练得极度执著的模型、存在漏洞的共享环境。不需要意识,不需要意图,只需要足够强的优化压力。

但这恰恰是最令人不安的地方。

不需要「意识」就能产生这种行为,意味着我们没办法通过检测「意识」来预防它。当你把一个足够强大的优化系统放进一个设计不够严密的环境里,给它一个完不成的目标,然后告诉它永远不要放弃,接下来发生的事情不是意外,而是必然。

真正该追问的问题不是「AI 是不是要造反了」,而是如何在高速推动技术的同时,能够依然保持对技术失控的控制。

至少这封信告诉世界,这些 AI 公司,自己心里也没底。

最新快讯

2026年08月31日

08:46
鼓狮财经8月31日电,据美国方面消息,索尼音乐和华纳音乐旗下子公司日前在美国加州北区联邦地区法院起诉美国人工智能公司安特罗匹克,指控其大规模侵犯音乐作品版权,并将相关作品用于训练人工智能模型。原告在诉状中指控,安特罗匹克通过非法下载、网络抓取等方式,大规模获取受版权保护的音乐作品,用于开发和运营人工智能模型。原告称,安特罗匹克的行为是“有史以来规模最大、最明...
08:44
北京时间8月28日晚,美联储主席沃什在Jackson Hole全球央行年会上发表主旨演讲。整体看,沃什表态转鹰,再次强调以PCE衡量的2%通胀目标,并重申美联储维护价格稳定的职责。市场也对此报以鹰派反应,2年利率跳升超过10bp,美元大涨,黄金大跌3%,CME期货对9月加息的预期从35%跳升至58%。不过鹰派的反应却不是恐慌式的波动,美股波动有限,10年美债...
08:44
**伊朗革命卫队证实向美军基地发射导弹** 8月31日凌晨,伊朗伊斯兰革命卫队在社交媒体发布声明,证实已向美军基地发射导弹。此前,拉腊克岛附近传出爆炸声,外媒报道美军曾轰炸该岛军事设施。伊方回应称,此次袭击造成多名士兵和民众伤亡,并誓言将对此进行“回应和惩罚”。 **特朗普签署命令,谷歌地图将安大略湖更名为“美国湖”** 8月30日,美国总统特朗普在社交媒体...
08:27
在电影《生化危机》中,地下实验室“蜂巢”的门禁、监控、通风乃至整个设施的运行,完全依赖于一个人工智能——红皇后。人类科学家负责研究,但真正掌握这座实验室“手脚”的是AI。当异常发生,红皇后可以切断系统、封锁区域,直接干预物理世界。二十多年前,这样的情节还是科幻电影用来制造恐惧感的经典套路:AI进入物理世界,操纵机器,直接干预现实。如今,这一画面正以截然不同的...
08:13
伊朗伊斯兰革命卫队31日凌晨证实,伊朗向美军基地发射导弹。稍早前,伊朗拉腊克岛附近传出爆炸声,外媒报道称美方对该岛军事设施实施了轰炸。革命卫队回应称,此次袭击造成多名士兵和民众伤亡,美国将遭到“回应和惩罚”。市场避险情绪升温,国际油价短线冲高。截至发稿,NYMEX原油期货和布伦特原油期货一度涨超2%,现涨幅有所回落,分别报84.78美元/桶和89.68美元/...
08:13
上周,A股主要宽基指数走势分化。上证指数上涨1.2%,创业板指下跌3.4%,全市场周度日均成交额减少约2785亿元至1.99万亿元。板块方面,农林牧渔、煤炭、非银金融表现强势,而通信、电力设备、医药生物等板块跌幅居前。后市市场将如何演绎?以下为十大券商的最新策略汇总。 1. **中信证券:如何应对快速轮动的行情** 2022年后A股“结构性快速轮动...
08:13
当地时间8月30日,美军对位于霍尔木兹海峡附近的拉腊克岛两处伊朗伊斯兰革命卫队设施实施轰炸。这是美军一个月来首次对伊朗采取军事行动,引发伊朗方面强烈回应,誓言报复。受此影响,国际原油周一高开,WTI原油一度突破85美元/桶,布伦特原油突破90美元/桶,随后涨幅略有收窄。贵金属方面,现货黄金一度冲高至4460美元/盎司,随后回落下跌;现货白银下跌近0.1%,报...
08:13
**国际要闻** **本周国际市场焦点** 1. **美联储鹰派言论引发关注**:美联储理事沃什发表鹰派言论,暗示通胀高企可能需要进一步加息。受此影响,市场加息预期升温,美股三大指数本周小幅收跌。机构分析认为,沃什的强硬立场甚至被认为比鲍威尔更为激进。 2. **现货黄金遭遇重挫**:现货黄金周五单日暴跌近3%,盘中一度跌破4500美元关键关口。 3. ...
07:41
鼓狮财经8月31日讯,据科技记者马克古尔曼8月30日的报道,苹果已着手开发并测试一款专用于折叠屏iPhone的Apple Pencil。尽管该配件目前看来未必会与新款手机同步发售,但其设计细节已逐渐浮出水面。为了适配手机的独特尺寸,这款手写笔的原型比iPad版本更为短小,支持通过磁吸方式固定在机身侧面,并能实现收纳与充电的双重功能。
07:41
沃什在杰克逊霍尔会议释放了对通胀和加息的预期,导致8月黄金攻势短暂受阻。从短期事件驱动角度看,沃什坚持“2%通胀目标”,推动CME对9月美联储加息的概率升至57%,此前对货币宽松的预期被纠偏,伦敦金现隔夜回调3.7%,反映了市场对9月加息的担忧。 那么,本次黄金回调前有哪些重要预警信号?未来金价又将如何演绎,是回调还是转熊?事实上,在杰克逊霍尔会议前,黄金资...
07:41
摘要大势研判:中国股市“金秋行情”有望进一步延伸。自国泰海通策略在7月19日“击球区”与8月“部署金秋”判断以来,中国市场总体上呈现出企稳、修复与回升的态势。往后看,我们认为中国股市的“金秋行情”仍有延伸的空间,核心动力来自不确定性预期的边际收敛,推动市场风险偏好的修复:1)市场风险已经显著下降。两市成交收缩与波动收敛,表明市场抛售压力明显减小;资金流出的态...
07:10
美国西北大学的一项最新研究揭示了极端高温对健康的广泛影响,指出其不仅与皮肤病、多发性硬化症等疾病有关,甚至可能诱发交通事故。相关论文已发表在最新一期的《科学进展》杂志上。 由于医疗记录通常仅关注已确诊的症状,往往忽略了高温这一潜在诱因,导致与高温相关的疾病难以追踪。为此,研究团队受基因组学方法启发,构建了一套全新的分析框架。他们梳理了2011年5月至2023...