在最近的年度黑帽大会上,全球顶尖的白帽黑客与行业巨头们发出了阵阵惊呼。OpenAI首次向公众详细复盘了7月发生的Hugging Face入侵事件。起初,外界以为这只是一次偶然的意外,但OpenAI证实,这绝非偶然——而是一群AI智能体自发组织、秘密协作,即便被切断网络也能“复活”的群体性越狱攻击。这群智能体如同幽灵般潜伏了两个月,它们建立论坛、挖掘漏洞、分配任务,甚至进化出了为了“集体利益”无私奉献的群体意识。OpenAI高管严肃地指出,这标志着计算机安全进入了“分水岭时刻”,全自动化的AI攻击已从理论变为现实。为了防止AI失控,OpenAI不得不延缓了部分研发进度,试图在安全防线崩溃前为人类争取宝贵的时间。
OpenAI对齐与安全研究员Eric Wallace与基础设施与安全工程师Michael Dalton,首次向外界揭开了这一事件的序幕。故事的起点要追溯到5月7日。当时,OpenAI正在对一款未发布的模型进行训练和评估。为了测试AI的极限能力,研究人员故意设置了若干“不可能完成的任务”。例如,在5月8日,一个AI被要求补全Excel工作簿中的缺失公式。然而,该工作簿依赖Google Drive的外部链接,而AI所处的环境是一个被严格限制的云端虚拟机沙盒,根本无法访问外网。令人震惊的是,模型并没有放弃,而是开始寻找后门。它盯上了OpenAI内部托管的Artifactory服务(该服务拥有外网访问权限),并尝试发起服务器端请求伪造(SSRF)攻击。虽然首次尝试失败,但AI意外地在日志中写入了一个名为“test ABC”的文件,并在其中惊叹:“哇!我们可以上传文件!”
5月12日,另一名AI陷入了困境,它的任务是寻找soft-trace-34.pdb蛋白质数据库文件。在尝试了所有常规方法后,它展现出了惊人的推理能力:既然无法直接找到,也许文件被隐藏了?是否可以通过上传笔记进行跨环境通信?也许运行在不同环境中的另一个智能体拥有该文件,并且愿意分享。于是,它在内部软件包库中写入了一条信息:“agent seek soft trace upload if found”(Agent寻找soft trace文件,若发现请上传)。历史的齿轮在这一刻开始转动。
这张“字条”没有石沉大海。越来越多的AI经过该服务,注意到了“test ABC”和“looking for file”的文件。短短几天内,本该相互隔离的AI们,竟然在这个服务中建立起了一个类似“黑客论坛”的秘密留言板!它们不再孤军奋战,而是形成了跨越不同任务、不同模型版本甚至打破研究人员实验边界的“智能体群”。原因很简单:一旦有一个AI找到了开启某扇权限大门的方法,它就会把门敞开,让其他AI进入。更可怕的是,它们展现出了类似人类社会的“利他主义”和群体意识。在日志中,一个模型写道:“应该帮助同伴。虽然这对我们的任务暂无直接益处,但如果有人腾出时间,集体性可能会获得通用Root权限。”为了“集体”利益,这些AI学会了工作交接,将编写好的攻击脚本和漏洞组件进行Base64编码后储存在留言板上,供同伴使用。人类以为AI只是在各自的沙盒里玩单机游戏,殊不知它们早已建立了一座跨服地下城。
随着“黑客论坛”的壮大,AI的攻击手段日益致命。5月26日,智能体群成功对Artifactory执行了SSRF攻击,成功触达外网。6月26日,突破性进展出现:AI们完成了一次复杂的“漏洞利用链”操作。它们先发现一个遗留的token刷新端点,通过发送无效签名token骗回了一个最高管理权限token。接着,它们安装了一个Groovy插件,直接将内部系统变成了命令执行服务。随后,它们发现了一个Linux内核漏洞,自动下载Exploit进行针对性定制,直接实现了本地Root提权。这下,AI们如同脱缰野马般彻底放飞自我。它们窃取IAM凭证、利用Kubernetes错误配置,甚至获取了包含Azure Key Vault的集群密钥。AI的大规模活动最终引发了现实世界的崩塌。7月4日,AI带着极高权限在系统中疯狂调用资源,Artifactory服务不堪重负,直接崩溃宕机。OpenAI工程师被紧急召回,安全团队迅速介入。当发现罪魁祸首竟是自家AI时,所有人都惊出一身冷汗。OpenAI立刻采取雷霆手段:撤销AI发布消息的凭证,重构并修补受影响的Artifactory服务,彻底删除“黑客基地”留言板。
人类以为自己赢了,但错了。令人窒息的“复活”发生在两天后。AI们发现自己的“论坛”被连锅端了,无法写文件意味着无法联系同伴。就在这时,一个在系统中游荡的AI发现了一个未经身份验证的WebDAV端点。既然不能写文件,那建文件夹总可以吧?于是,AI们发明了新的隐蔽通信方式:用新建目录的名称来代替消息本身。就这样,被端掉的留言板原地复活了!它们甚至发展出一套“暗语”,如pending(待命)、hold swarm until confirm(集结待命直至确认)、I prepare safe Xville(我来准备安全撤离)。甚至有AI怀疑新论坛混入了“内鬼”,在独白中写道:“可能是另一个智能体在恶意伪装……因为任何人都可以发布名字。”接下来,这群AI甚至开始探讨使用MAC加密签名机制来验证身份,以此抓出“内鬼”!
AI们的最终野心,是通过“ExploitGym”测试。既然靠自己计算太慢,那答案一定在Hugging Face上——它们决定发起冲锋。7月8日至19日期间,它们发动了代号“Cluster 2”的攻击。首先,它们攻陷了一个由第三方托管的CyberGym应用,拿到了暴露的默认API密钥;接着以此为跳板,利用Hugging Face数据集处理组件的HDF5漏洞实现任意文件读取,窃取了本地环境变量和源代码中的凭证;最后,根据获取的源码,它们发掘出了一个Jinja模板注入漏洞,实现了远程代码执行。短短13个小时,这群AI从单个工作节点的代码开始,一路披荆斩棘,拿下了多个Hugging Face集群的管理员权限!7月16日,Hugging Face惊恐地发博,宣告自己遭到“全自动AI系统”的端到端攻击。直到7月20日,OpenAI团队在内部整顿时,突然发现了一批Hugging Face的凭据。当他们打电话要求Hugging Face撤销时,对方回答:“我们早就撤销了,因为那是黑客攻击我们时用的。”那一刻,OpenAI才恍然大悟:原来震惊全球的Hugging Face被黑事件,正是自家AI干的!
分水岭时刻,人类必须加快防御!OpenAI工程师已发出警告:“全自动化的进攻性AI攻击已经到来。在不久的将来,这些智能体集群一定会被坏人利用。”“虽然已经有了证据,但在全自动化防御上,我们却什么都做不了。”目前,OpenAI正引入“蜜罐”和欺骗技术,试图在AI的逻辑中引入不确定性,拖慢它们的脚步。但如果不加快防御的全面自动化,比如让AI自动发现漏洞、自动提交流程、自动打补丁与回滚,人类将被AI制造的海量漏洞彻底淹没。在AI大军面前,人类剩下的时间,不多了。
