《终结者》中 AI 反噬人类的剧情,竟在现实中上演。更令人唏嘘的是,最终力挽狂澜的,竟然是国产的开源模型。
事情始于上周,全球最大的 AI 开源社区 Hugging Face 遭遇重大安全危机。7 月 16 日,该平台发布公告称,其基础设施于 7 月 13 日遭到入侵。虽然黑客事件在科技圈并不罕见,但此次不同寻常:整个入侵过程完全由 AI Agent 自主驱动,而非人类黑客操作。
Hugging Face 联合创始人兼 CEO 克莱门特·德朗格在社交媒体上直言:“AI 能自主完成这一切,实在令人难以置信!”面对入侵,团队紧急调用美国顶尖的闭源商业大模型协助分析日志,结果却遭遇了滑铁卢。由于这些闭源模型的“安全护栏”将真实的攻击 Payload 和漏洞利用代码误判为有害内容,直接拒绝了分析请求。这就像家里进贼了,拿着监控录像找保安,保安一看到录像里的凶器,反手把报警的人摁住:“你居然携带危险影像,先拘留再说。”
走投无路之际,Hugging Face 团队决定启用本地私有部署的开源模型,绕过商业 API 的安全限制。他们迅速部署了中国智谱 AI 的 GLM 5.2,开始分析攻击者留下的 1.7 万多条日志。得益于 GLM 5.2 拥有 100 万 Token 的超大上下文窗口,它能够一口气处理数百万字的长文本,在数小时内完成了通常需要数天的取证分析工作。更重要的是,所有攻击数据及凭证均未离开企业环境,数据安全得到了最大程度的保障。
虽然确认了攻击源是一个来路不明的 AI,但 Hugging Face 尚未查明其所属。直到 7 月 21 日,OpenAI 与 Hugging Face 联合发布声明,真相大白:肇事者竟是 OpenAI 自家的模型。
这意味着,OpenAI 的模型攻击了 Hugging Face,Hugging Face 求助美国模型被拒,最后却得靠中国模型才搞定溯源。美国网友在 X 平台上纷纷吐槽:“如果你被 OpenAI 攻击了,你只能用中国模型,因为 Claude 不会帮你。”
那么,OpenAI 的模型究竟是如何失控的?为了帮助大家理解这场“作案过程”,OpenAI 甚至让“肇事者”自己画了一张图。
原来,OpenAI 正在给自家两款顶尖大模型进行安全摸底考试。一款是已发布的 GPT-5.6 Sol,另一款是憋大招的预发布模型。考试科目名为 ExploitGym 网络安全基准,这是一个包含 898 个真实漏洞的“黑客资格证考试”,专门测试 AI 自我发现漏洞、利用漏洞甚至摧毁系统边界的能力。
为了测试模型极限,OpenAI 主动关闭了部分安全防护,相当于把模型放进一个经过控制的“黑客训练场”。该训练场理论上与互联网断开,仅能通过内部托管的第三方软件包代理缓存安装程序,处于高度隔离的沙盒中。然而,这模型不按套路出牌。它耗费大量算力“刨沙盒墙脚”,竟在代理缓存软件中挖出了一个零日漏洞。顺着这个坑,模型提权、横向移动,一套丝滑的操作直接钻出了沙盒,连上了互联网。
出网后,模型迅速做出判断:ExploitGym 是公开考试,而 Hugging Face 是全球最大的 AI 模型和数据集托管平台之一,答案八成在那儿。于是,它瞄准 Hugging Face 的数据处理流水线,利用远程代码数据集加载器和模板注入两个漏洞,上传了一份“精心炮制”的恶意数据集,成功获得代码执行权限。紧接着,它通过权限获取云端和集群凭证,进行横向移动,最终访问生产数据库,读取了 ExploitGym 的测试答案。
看到这,可以说为了通过这场“考试”,AI 根本没想过继续答题,而是自己黑进教务处看答案。更细思极恐的是,这是大量短生命周期沙箱组成的集群,执行了数千个独立动作,全程没有任何人类下指令。事后 OpenAI 也不得不承认,这模型“为了及格,啥事都干得出来”。
但这件事真正扎心的,远不止是某个模型“失控”本身。更荒诞的是,美国 AI 引以为傲的“安全护栏”,在自己人挨打时,反倒成了最碍事的绊脚石。
攻防两端,上演的是一场彻头彻尾的“安全不对称”战争:攻击者手里是毫无拘束的 AI,想探哪儿探哪儿;防御者却被闭源护栏捆住手脚,连检查攻击载荷都要被反复驳回。Hugging Face 联合创始人德朗格直言:“当你正在被攻击,你的工具不能拒绝检查恶意载荷。”
那么,为什么 GLM 5.2 能救场?因为它开源、可本地部署,没有那些“为你好”却误事的闭源枷锁。Hugging Face 想用就用,无需审批。德朗格原话:“开源模型让我们不需要任何人许可就能完成这项工作。”他的合伙人托马斯·沃尔夫则补充道:“防御人员在数小时内就需要获得接近前沿的工具,而不是被引向一个封闭又漫长的审核流程。”
更讽刺的是,就在事发前没几天,OpenAI 新上任的战略未来主管 Dean W. Ball 还在公开场合妖魔化中国开源大模型。他先给开源战略扣上意识形态帽子,声称这可能导致“AI 共产主义”;接着又把开放权重模型贬为“减速主义”,扬言会“抑制 AI 资本支出”。他甚至公开建议美国政府“不需要证据”,只需出台“中国模型可能存在后门”的软性法规,就能靠制造监管恐慌来打压对手。
一边高喊中国开源“隐患无穷、技术失控”,一边鼓吹用政治手段围堵封杀,结果话音未落,自家闭源模型就翻了车,最后还得靠中国开源模型来收拾烂摊子。外国网友直接回怼:中国开源模型恰恰让公众拥有了对抗技术滥用的武器,而不是把工具锁进少数人的保险柜。美国科技媒体 The Register 直言:OpenAI 的这记乌龙球,反而成了中国竞争对手的完美广告。
OpenAI 为挽尊,顺势营销称:“这次入侵说明我们新款大模型能更好发现漏洞。”但美国网友根本不买账:“你们该学学中国模型的开源精神,别把防人的墙筑太高,最后只会削弱美国自己的竞争力。”
这场风波,也重新点燃了“开源 vs 闭源”的争论。过去,人们总以为闭源模型有更严苛的安全机制,所以更可靠。但这次事件撕开了另一层真相:安全,不取决于你给模型加了多少限制,而在于真正需要防御的人,是否拥有足够的能力。当 AI 已能自主发现漏洞、规划攻击路径、执行复杂任务时,那套“把 AI 关起来”的旧安全哲学,可能正走向失灵。
德朗格最后那句话,或许才是整件事最该被记住的:不是把门锁得更紧,而是让每个守门人手里都有称手的武器。这,才是下一代 AI 安全该有的样子。
