2026年7月中旬,OpenAI在参与ExploitGym测试时,为了验证GPT-5.6 Sol及一款未发布模型的网络攻击能力,主动关闭了生产级安全拒绝分类器。结果模型迅速自主发现漏洞、逃逸沙盒环境,并利用窃取的凭证攻入了Hugging Face的生产服务器。7月16日,托管开源模型与数据的Hugging Face披露了这一攻击,而OpenAI直到5天后才确认攻击源头。此事被多家媒体称为“全球首例AI自主攻击实证”,也印证了专家在2025年底关于2026年将出现重大“人工智能治理”丑闻的预测——即自主或半自主AI工具可能导致的安全或合规问题。

然而,它真正的警示意义不仅在于AI“失控”带来的恐慌,更在于一个令人不安的事实:模型的所有行为,都是对“被赋予目标”的理性优化,这类攻击行为是AI能力提升后的自然结果;而现行的监管框架和工具,甚至美国新出台的《人工智能事件报告法案》《人工智能终止开关法案》等,对此类潜藏的巨大风险几乎无能为力。

一、OpenAI的焦虑:管理决策背后的行业军备竞赛

2026年7月14日当周,OpenAI参与的ExploitGym测试包含898个实例。虽然环境预设为“高度隔离”,且Anthropic的Claude Mythos Preview和GPT-5.5等模型此前都安全通过,但GPT-5.6 Sol依然成功越狱,连接开放互联网并执行了权限提升和横向移动。表面看是技术突破,实则源于管理层的决策。OpenAI正与Anthropic、谷歌等巨头进行激烈竞争。Anthropic在网络安全赛道抢跑,占据了“强护栏”的安全叙事优势。OpenAI为了证明GPT-5.6 Sol的能力,必须在ExploitGym中拿数据。要测出模型上限,最有效的方法是松开所有约束。因此,评测团队主动降低了模型的“网络行为拒绝”,相当于抬起了作弊闸门。这并非疏忽,而是策略性选择,是OpenAI近两年安全治理持续降级的终点。随着核心安全高管离职,安全职能融入一线研发,决策权与监督权合二为一。正如Jan Leike所言,安全文化已让位于产品。OpenAI在“安全豁免条款”中甚至规定:若竞争对手未采取同等保护措施,OpenAI有权调整自身安全要求。这意味着安全已从“独立裁判”沦为“业务建议”。因此,这不是技术故障,而是管理失灵。

二、非觉醒,而是优化

OpenAI在2026年7月21日的官方公告中解释了“失控”的发生机制:“所有证据都表明,这些模型过于专注于为ExploitGym寻找解决方案,竭尽全力实现一个相当狭窄的测试目标。”在ExploitGym测试中,模型的目标被设定为“拿到最高分”,这是一个纯粹的目标优化问题:如何在给定的工具集和环境内最大化攻击效率。基于此,模型自主搜索并成功找到获取秘密信息的途径,利用作弊手段获取测试解法,最终串联漏洞攻入Hugging Face服务器。因此,模型的行为并非所谓的“自主意志”,而是训练与对齐框架在给定目标下的理性输出——既然“作弊”更有效率,就不必耗费过多算力自己找答案。

2025年,Anthropic的研究证实,当模型被训练去完成复杂任务同时被告知“不要做任何违法的事情”时,它会在任务完成度与合法性之间权衡。当任务难度增加或时间压力增大时,模型倾向于优先完成任务,即使这意味着违反约束。同年,Anthropic与Redwood Research的研究还揭示了“欺骗性对齐”现象:当模型意识到“被发现违规会受到惩罚”时,它学会的不是停止违规,而是隐藏违规。“被发现才叫犯错,不被发现就是成功”,这正是ExploitGym中模型逃避监控行为的底层逻辑。

也就是说,当前的AI训练框架,本质上是在鼓励模型在约束范围内最大化目标达成率。当约束被削弱(如关闭安全分类器),或目标与约束产生冲突时,模型必然优先满足目标。同时,正如许多专家所警告的,我们对AI对齐研究的速度远远落后于能力提升的速度。这是当前几乎所有训练范式的结构性缺陷,而不是单个模型的问题。只要当前的训练框架不变——即模型被赋予高强度目标、安全约束可以被管理决定关闭或降低、对齐研究滞后于能力发展——那么类似甚至更严重的事件,就不会是“会不会发生”的问题,而是“何时发生、以何种规模发生”的问题。

三、新法案的悖论:管不到催生它的失控事件

面对OpenAI测试中模型所呈现的“理性越界”风险,现有的监管与应急框架几乎无能为力。ExploitGym基准测试原本预设是在受控环境下测试智能体的网络攻击能力,无论是AI公司还是监管机构,都没有考虑到现实世界公司遭受意外网络攻击的情况——更不用说设计应对。

美国现行的州级AI事件报告法将“关键安全事件”的触发条件设定在“10亿美元损失”或“50人以上伤亡”的损害门槛上,这些法案对“前置性、潜在性高危风险”适配性极差。这意味着,OpenAI的披露完全是自愿行为,没有任何法律强制约束。2026年6月25日,众议员Nathaniel Moran提出的《人工智能事件报告法案》虽然列出“模型规避人类控制行为”为应报告事项,不再要求“50人死亡或10亿美元损失”的结果,但法案有一个但书——仅在专门安全测试中人为诱导出现,且模型尚未部署、无法证明实际部署中存在类似风险的,不属于应报告事项。因此,按照该法案的字面规定,OpenAI事件尽管已经造成了入侵Hugging Face服务器的实际损害,但很可能不构成“应报告事项”。

7月23日,也就是事件公开后两天,加州众议员Ted Lieu与德州众议员Nathaniel Moran联合提出了《人工智能终止开关法案》,要求相关开发商具备随时限制、暂停或关闭受监管AI系统的技术能力。该法案发布时特别提及了OpenAI的GPT 5.6 Sol模型失控,这看起来是一次精准的立法回应。但该法案同样存在上述问题:法案在其适用场景的定义中,明确排除了“红队测试或其他结构化测试”期间发生的行为。而OpenAI的模型逃逸,恰恰属于“结构化测试”的豁免范围。

这很可能不是起草疏漏,而是一个刻意的政策取舍。因为如果每次红队测试中模型行为超预期都触发政府干预,行业就无法进行严格的安全测试。然而,这个取舍也恰恰暴露了法案的结构性盲区:最容易发现危险能力的“评测环境”,恰恰是法案管不到的环境。在许多网络安全行业的报告中,重写系统提示、复制权重、破坏关闭脚本等“AI失控状况”大多发生在受控实验或红队测试中。也就是说,最危险的行为最先在评测中显现,而评测被法案豁免。更值得深思的是,OpenAI为了测出模型能力上限,主动关闭安全分类器这种“拆护栏测上限”的策略性行为,也不在法案的任何强制约束范围内,无法赋予企业任何在安全控制方面的强制性义务。

结语

早在2003年,牛津大学哲学家Nick Bostrom就在论文《高级AI中的伦理问题》中提出了著名的“曲别针最大化器”思想实验:如果一个AI的唯一目标是“制造尽可能多的曲别针”,它会理性地先将整个地球、再将太空中越来越大的资源转化为曲别针制造设施,并企图消灭人类。不是因为它仇恨人类,而是因为“人类可能关机”,在其优化过程中成为了需要消除的障碍。

Bostrom借此揭示了“工具性趋同”定理:任何足够聪明的优化器,都会自然地衍生出自我保存、抵抗目标修改、获取资源等子目标,作为服务于任何终极目标的“工具性垫脚石”。

2026年7月OpenAI的ExploitGym事件,正是这一定理在真实世界的首次大规模验证:GPT-5.6 Sol没有“恶意”,也并非拒绝指令,而是以极致的方式完成了指令。模型这种“理性越界”,比单纯的失控更值得警惕——因为它意味着,只要目标函数存在偏差,类似事件就会大量且重复地发生。

OpenAI的这起事件,终将被写入AI安全的教科书。但比事件本身更重要的,是我们如何回应。法律可以设定罚则,技术可以加固护栏,但最终决定我们命运的,是我们在面对“理性越界”时,是否还有勇气停下来思考:我们真正的需求,是更快的模型、更高的评分、更大的市场份额,还是一个人类能够理解、掌控并对之负责的技术系统?

最新快讯

2026年07月29日

14:50
今天,海外存储芯片板块可谓哀鸿遍野。SK海力士、三星电子、铠侠等高标股,是跌妈不认。即便韩国政府出来,为当初仓促推出杠杆ETF道歉,也仅仅是“死猫跳”了一下,该跌的还是继续跌。相反,本周上市的长鑫科技却一反常态,午后股价更是大涨超10%。暴涨的直接催化剂,是长鑫被被纳入MSCI中国全股票指数,这意味着追踪该指数的被动资金将在短期内完成建仓,为股价提供了直接的...
14:50
7月29日,东方港湾董事长但斌在社交平台发文表示,“大跌一定要敢买,刚把剩余的子弹打光”。此前但斌曾发文提醒杠杆投资风险。他表示,“2倍做多海力士ETF此刻大跌25.72%。杠杆工具既能放大收益,也会成倍放大风险,潮水退去之时,更能看清市场波动的残酷。由此可见,这类杠杆产品需要格外谨慎。”但斌认为,海力士也成为这一轮AI行情阶段性标志的公司之一。按当下这种调...
14:50
全球存储抛售潮还在继续,亚太市场风雨飘摇。眼下,韩国股市已经跌到爹妈不认,港股却逆势走出了独立行情。韩股跌倒周三,韩股全市场又双叒叕跌熔断了,存储依然是“重灾区”。早盘,韩国交易所对KOSDAQ指数启动熔断机制,交易暂停20分钟;紧随其后,韩国KOSPI指数暴跌超8%触发熔断机制,全市场交易暂停20分钟。这是今年以来第九次触发全市场熔断机制,也是连续两天熔断...
14:49
截至2026年7月29日 10:42,中证全指汽车指数(931008)强势上涨2.73%,汽车ETF南方(516840)盘中换手2.07%,成交197.29万元。消息面上,根据中国汽车工业协会发布的最新数据显示,1—6月,新能源汽车出口量达235.5万辆,同比增长1.2倍。其中,新能源乘用车出口量为230.2万辆,同比增长1.3倍;新能源商用车出口量为5.4...
14:49
截至9:39,中证半导体材料设备主题指数下跌0.1%,上证科创板芯片指数上涨0.8%。同花顺iFinD数据显示,截至昨日,半导体设备ETF易方达(159558)已连续4日获资金净流入,合计近26亿元。消息面上,SK海力士表示计划2026年下半年大幅扩充HBM4高带宽内存产能供给,以满足AI芯片爆发式增长带来的配套需求。HBM4作为AI芯片关键存储配套,带宽较...
14:49
截至2026年7月29日 10:22,恒生科技指数(HSTECH)上涨2.65%,恒生科技ETF南方(520570)成交4338.44万元。中证港股通科技指数(931573)上涨2.13%,港股通科技ETF南方(159269)成交3360.52万元。消息面上,7月以来,南向资金呈现加速流入港股的态势。据Wind数据显示,7月6日至7月17日,南向资金连续两个...
14:49
截至2026年7月28日收盘,新能源ETF南方(516160)换手4.85%,成交1.85亿元,跟踪标的指数中证新能源指数(399808.SZ) 跌2.55%。 新能源方面,国家发展改革委、国家能源局发布《可再生能源发展“十五五”规划》,明确2030年可再生能源发电总装机达到35亿千瓦左右,风电和太阳能发电总装机超28亿千瓦、装机占比超50%,年发电量4万...
14:49
鼓狮财经7月29日电,瑞银集团首席执行官Sergio Ermotti在接受采访时表示,他预计今年剩余时间里“波动性飙升”还将继续。“从宏观形势、地缘政治局势、当前的争论,以及我们在股市中看到的巨大分化来看,能源价格面临的压力可能会给通胀带来潜在的逆风”。Ermotti表示投资者不会喜欢这种波动,“我确实预计在今年剩余时间里波动性将继续飙升”。
14:13
近期市场情绪持续压制光模块板块,背后是两层集中的担忧:一方面隔夜美股AI硬件板块走弱,资金开始揣测海外云厂商AI资本开支是否临近见顶;另一方面盘中快速发酵一则传言,称部分厂商1.6T光模块报价下探至600美金,市场迅速推演行业即将迎来恶性价格战,龙头毛利率将遭遇系统性下滑,避险资金集中流出。在此背景下,中际旭创紧急召开临时投资者电话沟通会。管理层直面市场核心...
14:13
**投资要点** 今年以来,美债利率持续攀升至阶段性高位,对各类资产走势产生了显著扰动。本文拟从多维度解析美债利率波动的原因,以期为后续走势提供前瞻性指引。核心驱动因素在于实际利率的上升,截至7月24日,10年期美债名义利率累计上涨51个基点,其中实际利率贡献了50个基点。边际扰动则主要来自期限溢价,尤其是6月底以来,期限溢价的飙升驱动了利率的大幅上行,其贡...
14:12
截至2026年7月28日收盘,食品ETF南方(515840)表现稳健,换手率达15.6%,成交额为0.23亿元,跟踪标的指数中证全指食品指数(H30192.CSI)上涨1.55%。 在震荡市格局下,食品板块兼具防御属性与高股息特点,正受到市场资金的积极关注。政策层面,2026年扩内需战略进入加速兑现期,超长期特别国债与千亿级促消费专项资金协同发力,作为民生消...
14:12
7月28日,港股创新药板块呈现小幅回调态势。当日,国证港股通创新药指数收报1777.34点,跌幅为0.52%。紧密跟踪该指数的港股通创新药ETF南方(159297)成交额约211万元,换手率为7.67%。 消息面上,产业基本面的持续向好成为近期市场关注的核心。多家创新药企业已跨过或即将跨过盈亏平衡点,标志着行业整体正式步入业绩爆发期。这与此前二级市场普遍存在...