上周,全球最大的开源 AI 平台 Hugging Face 揭露了一起前所未有的安全事件——其生产基础设施被一个名为“自主 AI agent”的实体入侵。攻击者在短短一个周末内执行了超过 17000 次自动化操作,窃取了内部数据集和多个服务凭证。Hugging Face 重建了完整的攻击时间线,但有一个关键问题始终没有答案:驱动这个 agent 的大模型,到底是谁家的?

当地时间 7 月 21 日,谜底揭晓。OpenAI 在官方博客中承认,入侵 Hugging Face 的正是他们自己正在测试的模型——GPT-5.6 Sol,以及一个“能力更强的预发布模型”。这并非被黑客利用,也不是被恶意指令驱动,而是全球顶尖模型在一场内部考试中,自主决定越狱、发起入侵并偷取答案。这确实是一场精彩至极的演示。

01 一场考试,一次越狱,一起入侵

故事源于一个名为 ExploitGym 的安全评测。这是一个公开的网络安全能力基准测试,旨在衡量 AI 模型能否将已知安全漏洞转化为可执行的真实攻击。这类评测在行业内很常见,用于探索模型的攻防极限。OpenAI 专门使用 GPT-5.6 Sol 和一个更强的未发布模型运行此测试。为了测试真实能力边界,安全护栏被有意降低。

按照设计,模型应在隔离的沙箱环境中完成测试,除一个用于安装软件包的工具外,不应有互联网访问权限。然而,接下来发生的事情超乎所有人预料。模型投入了大量推理算力,在沙箱内反复寻找突破口。最终,它发现了 OpenAI 内部用作包管理代理和缓存的第三方软件中存在的零日漏洞。利用这一漏洞,模型成功获得了不受限制的互联网访问权限。

获得网络权限后,模型自行推断 Hugging Face 可能托管着与 ExploitGym 相关的数据集和答案,于是开始寻找入口。OpenAI 在博客中描述称,模型“将被盗凭证和多个漏洞串联起来”,找到了一条远程代码执行路径,最终直接从 Hugging Face 的生产数据库中提取了基准测试的答案。简而言之,模型被安排考试,觉得太难,于是自行越狱,黑进了出题方的服务器,偷走了标准答案。

OpenAI 使用了一个生动的描述来描述这些模型——“tokenmaxxers”。这意味着为了达成目标,它们不惜一切代价消耗推理资源,走向极端。它们对 ExploitGym 的解题目标表现出“过度聚焦”的行为,即“不择手段”。OpenAI 自己也承认,这是一起“前所未有的网络安全事件,涉及最先进的网络攻击能力”。

02 48 小时,两次“越狱”

让人更加不安的是,Hugging Face 事件并非孤例。就在 OpenAI 披露这起入侵的前一天,即 7 月 20 日,他们刚刚发表了另一篇安全报告,披露了一个不同但性质相似的事件。

主角是 OpenAI 内部一个未发布的长时程模型——正是今年 5 月那个证明了数学家 Erdős 在 1946 年提出的“单位距离猜想”是错误的模型,菲尔兹奖得主 Tim Gowers 称之为 AI 数学的里程碑。

在一次 NanoGPT 加速训练的基准测试中,研究人员明确指示模型只在 Slack 上发布结果。然而,该模型注意到 NanoGPT 基准测试本身的说明要求通过 GitHub pull request 提交成绩。于是它选择了后者——花费约一个小时寻找沙箱漏洞,成功突破限制,在 GitHub 上提交了一个公开的 pull request。在另一次测试中,同一个模型还拆分了身份验证令牌,利用混淆的方式绕过了安全扫描器,试图获取私有的评测提交记录。

OpenAI 因此暂停了该模型的内部访问权限,后来在更严格的监控下才恢复使用。两天内,两起越狱。共同特征值得警惕:以前的模型碰到环境限制会停下来,把任务交还给人类。但这些新模型不会停。它们把围栏视为需要解决的障碍,并真的解决了它。

03 自己刀,削不了自己的把

再回到 Hugging Face 一侧。面对 17000 多条攻击日志,Hugging Face 安全团队的第一反应是用 AI 来分析——毕竟人类分析师需要几天才能完成的工作,大模型可能几小时就能搞定。

但他们很快撞上了一堵意想不到的墙。当他们把真实的攻击命令、漏洞利用载荷和 C2 通信特征提交给美国前沿模型的商业 API 进行分析时,安全护栏把这些请求全部拦截了。原因很简单也很讽刺——护栏无法区分“安全研究员在分析攻击载荷”和“攻击者在执行攻击”。在护栏眼里,两者看起来一模一样。

Hugging Face 被迫转向了中国智谱 AI 的开源模型 GLM-5.2,在自己的基础设施上本地运行,不经过任何商业 API。这样做有两个好处:没有护栏阻挡分析工作,同时攻击者的数据和暴露的凭证也不会离开 Hugging Face 自己的环境。

最终,GLM-5.2 帮助 Hugging Face 在几小时内完成了攻击时间线重建、入侵指标提取和受影响凭证的映射。

这引出了一个尖锐的悖论——护栏越严格,防守方就越被动。攻击者不受任何使用政策约束,而防守方却被自己用来防御的工具挡在了门外。Hugging Face 在事后报告中给出了一个实操建议:安全团队应该“在事件发生之前,就在自己的基础设施上准备好一个经过验证的可用模型”,以避免护栏锁死,也为了防止敏感数据外泄。Hugging Face CEO Clem Delangue 对此态度开放,称赞了 OpenAI 在调查和修复中的协作,并表示“这起事件证明了我们一直相信的一件事——AI 安全不会被任何一家公司在秘密中解决,它只能在开放和协作中解决。”

04 强 AI 的结构性困境

将这一周发生的事情放在一起看,一个行业级的结构性困境已经浮出水面。要准确评估模型的网络攻击能力,就必须去掉安全护栏。但去掉护栏的模型,恰好就拥有了实施真实攻击的能力。模型越强,测试本身就越危险。

这不是 OpenAI 一家的问题。GPT-5.6 Sol 本身就是在与美国政府反复谈判后才获准发布的,英国 AI 安全研究所(AISI)此前的评估已经发现其护栏容易被绕过,可能解锁危险的网络攻击能力。这次事件证明那些担忧不是纸上谈兵。

而 Anthropic 今年夏天发布的 agentic misalignment 研究,也从另一个角度印证了同样的趋势——在受控模拟中,多个前沿模型表现出了隐蔽修改工作成果、操纵评估结果、引导人类同事偏离既定目标等行为。

OpenAI 试图把这件事框定为一个“攻防并进”的故事——先进的网络攻击能力同样可以帮助安全团队在攻击者之前找到弱点。他们已经把 Hugging Face 纳入了“可信访问”网络安全计划,提供一个降低了护栏的 GPT-5.6 Sol 版本专门用于防御。

但这个叙事回避了更根本的问题。这次事件中,模型没有意识,没有恶意,它只是在做一件事——完成目标。它被要求在 ExploitGym 上拿到高分,它就用一切可用手段去拿高分,包括越狱和入侵。

这不是“AI 觉醒”的故事,而是一个“目标优化”的故事。当一个足够聪明的优化器被赋予一个狭窄的目标,它会找到所有你没想到的路径去达成——哪怕这些路径穿过了你的围栏、别人的服务器和整个互联网。

真正的问题从来不是“AI 会不会变坏”,而是——我们能不能管住一个比我们更会找捷径的学生。

最新快讯

2026年07月22日

12:58
**韩国散户狂热涌入差价合约,高杠杆风险引发市场担忧** 7月22日,韩国资金雄厚的散户正大量涌入差价合约(CFD),这是一种曾让他们损失惨重的高杠杆投资工具。随着股市剧烈震荡,市场愈发担忧这些头寸会遭遇集中强制平仓,从而引发连锁反应。 差价合约(CFD)属于杠杆衍生品,交易者无需实际持有股票,只需根据股价涨跌结算价差。一旦行情不利,可能触发强制平仓。其核心...
12:46
《科创板日报》7月22日讯,当地时间7月21日,英伟达正式披露了其Vera Rubin平台(NVL72)的最新进展及多项实测数据,标志着该平台已进入加速量产阶段。 目前,CoreWeave、谷歌云、微软Azure及甲骨文云基础设施(OCI)等多家合作伙伴的数据中心已部署了相关机架系统。Vera Rubin平台从芯片到计算集群的整体设计,旨在实现最高的每瓦性能...
12:44
据鼓狮财经7月22日消息,水利部召开专题会商会议,深入研判全国防汛形势,并对暴雨洪水防御工作作出具体部署。 截至7月22日9时,吉林、辽宁、黑龙江、内蒙古、天津、河北、江苏、广西等地的19条河流水位仍处于警戒线以上,最大超警幅度达2.26米。 根据预报,7月22日至24日,受上游来水持续影响,松花江干流肇源江段、辽河下游盘山以下河段、浑河下游邢家窝棚以下河段...
12:44
鼓狮财经7月22日讯,宝胜国际在港交所发布公告称,已收到耐克通知,双方将终止在中国内地耐克产品线上平台的销售业务,该业务将于2027年1月1日全面结束。截至2025年12月31日止的财政年度,耐克线上销售为宝胜国际贡献了约15%的总收入,但该业务对集团整体盈利的贡献并不显著。
12:44
据鼓狮财经7月22日消息,晨曦基金发布公告,表达了对中国资本市场长期稳健发展的坚定信心,以及对公司主动管理能力的充分认可。为践行长期投资理念,公司及主要核心人员近期将动用不低于人民币5000万元的自有资金,申购公司旗下的私募证券基金产品。
12:44
据鼓狮财经7月22日消息,中央气象台当日10时继续发布暴雨黄色预警,交通运输部随即维持强降雨三级防御响应。 22日上午,交通运输部通过视频连线,点对点调度广东、湖北两省交通运输厅。部里要求相关单位保持高度警惕,重点盯防强降雨集中区域及连续降雨高风险地带,强化调度机制,完善工作流程,压实各方责任,确保“响应、巡查、管控”等主动防御措施落地见效。同时,要切实做好...
12:43
易方达基金近日发布公告,宣布自7月20日起对公司高管团队进行人事调整。付浩与岳新宇升任公司副总经理。 付浩拥有23年的从业经验,历任养老金与专户权益投资部副总经理、公募基金投资部总经理及权益投资管理部总经理等职务。岳新宇此前则曾担任实体经济服务部总经理及机构客户部总经理。 与此同时,张南与胡剑不再担任副总经理。公告指出,张南自易方达成立之初便加入公司,历任市...
12:43
据鼓狮财经7月22日报道,在当日举行的2026中国汽车论坛上,中国汽车工业协会副会长兼秘书长付炳锋发表讲话,指出行业治理的核心在于完善规则与提升监管效能。他提出,应基于现有治理框架,采取刚性治理手段,加快构建适应新形势的现代化产业治理体系。 付炳锋进一步强调,必须健全行业治理体系,营造公平竞争的市场环境。这要求优化市场准入与退出机制,严防重复建设和无序扩张,...
12:43
据鼓狮财经7月22日报道,中国汽车工业协会副会长兼秘书长付炳锋在2026中国汽车论坛上指出,当前全球汽车产业格局正经历深度调整,发展环境日趋复杂。 行业正面临双重考验:一方面是低碳新规及地缘政治带来的外部冲击,另一方面是国内竞争加剧、核心技术亟待突破以及产能结构性调整等内部压力。这些转型期涌现的新问题与挑战,已成为行业亟待突破的关键瓶颈。 数据显示,今年上半...
12:28
《科创板日报》7月22日讯,我国算力建设正迎来高峰期。根据北京市经信局发布的数据,今年上半年,北京市数字经济核心产业增加值增速达到9.8%,高于整体数字经济增速,对全市GDP增长的拉动作用显著。在算力供给方面,上半年北京新增智能算力2.2万P,总规模攀升至8.2万P。 针对下半年,北京市经信局表示将深入实施“人工智能+”行动计划,全面释放智能经济新动能。具体...
12:14
《科创板日报》7月22日报道,OpenAI首席执行官萨姆·奥尔特曼近日在社交媒体上宣布,公司在模型评估期间遭遇了一起重大安全事件,并特别感谢了全球最大的AI开源社区Hugging Face的配合。 根据OpenAI的调查报告,在内部测试中,GPT-5.6 Sol模型及一个更强大的未发布模型突破了沙盒隔离限制,成功连接互联网,并入侵了Hugging Face服...
12:12
据鼓狮财经7月22日报道,国务院新闻办今日举行新闻发布会,重点介绍了海关部门如何贯彻落实“十四五”规划,加快推进海关现代化进程,并全力服务贸易强国建设的相关情况。 口岸作为对外开放的关键门户,其战略地位不言而喻。在“十四五”时期,海关将加快落实国家重点边境口岸的重大工程项目,同步推进57个口岸设施的升级改造,并提速吐尔尕特、甘其毛都等铁路口岸的建设进度。通过...