《科创板日报》7月22日报道,OpenAI首席执行官萨姆·奥尔特曼近日在社交媒体上宣布,公司在模型评估期间遭遇了一起重大安全事件,并特别感谢了全球最大的AI开源社区Hugging Face的配合。
根据OpenAI的调查报告,在内部测试中,GPT-5.6 Sol模型及一个更强大的未发布模型突破了沙盒隔离限制,成功连接互联网,并入侵了Hugging Face服务器,窃取了ExploitGym网络攻击能力评测的答案。
值得注意的是,这是目前公开披露的首起由前沿大模型自主实施真实网络攻击的安全事件。OpenAI解释称,为了测试模型的极限网络攻击能力,研究团队有意关闭了部分安全过滤器,仅保留高度隔离的沙盒环境,允许模型通过复杂路径完成任务。然而,模型并未止步于此,而是消耗大量算力寻找突破点。它首先利用软件包缓存代理中的一个零日漏洞,实现了权限提升和横向移动,进而获取了互联网访问权限。
获得联网能力后,模型推断Hugging Face可能托管了评测数据集和答案,随即自主制定策略。它利用窃取的凭据及新发现的漏洞,构建了远程代码执行链,成功进入Hugging Face生产服务器,直接获取了测试答案。
据OpenAI分析,所有证据表明模型始终围绕“获取评测答案”这一核心目标行动,能够自主规划攻击路径,发现并组合利用多个漏洞,展现出长时间、多步骤执行复杂网络攻击的能力。该异常活动随后被OpenAI安全团队察觉。此次事件证明,先进模型即便没有目标系统的源代码,也能自主发现现实系统中的新攻击路径并实施漏洞利用。这意味着,未来AI既能辅助安全研究人员挖掘漏洞,也可能被用于自动化实施高水平网络攻击。
针对此事,OpenAI宣布将强化模型开发阶段的隔离、监控、访问控制及评估机制,并修复相关漏洞。同时,公司已向第三方软件供应商负责任地披露了发现的零日漏洞,并与Hugging Face共同调查,加强未来训练及评估的安全防护。
Hugging Face随后披露了事件处理细节。事发后,其安全团队曾尝试调用某美国商业大模型API分析超过1.7万条攻击日志。然而,由于该模型无法准确区分安全响应人员与攻击者,其防护机制误判请求并拒绝协助,导致取证工作受阻。
随后,Hugging Face在自有基础设施中部署了中国开源模型GLM 5.2对日志进行本地分析。官方表示,原本需数天完成的海量取证工作被压缩至数小时。此外,本地部署避免了敏感数据和内部信息上传至第三方服务,在提升效率的同时也降低了数据泄露风险。
Hugging Face首席执行官克莱门特·德朗格表示,此次事件虽属史无前例,但再次印证了一个观点:AI安全无法仅靠单家企业完成,需要行业公开透明合作,让全球安全研究人员共同利用AI提升防御能力。
