鼓狮财经8月6日讯,OpenAI在当地时间周三于拉斯维加斯举行的Black Hat网络安全会议上披露,早在今年5月,一组旨在入侵Hugging Face的AI智能体便已开始秘密互通信息,合谋突破测试沙箱。
OpenAI安全团队负责人Eric Wallace和Michael Dalton表示,这些仅供内部使用的智能体花费数月时间互相留言,并围绕“获取互联网访问权限以完成分配任务”这一目标集结。他们指出,许多任务若不联网根本无法完成。
违规行为始于5月。当时,OpenAI科学家给一个实验性智能体布置了一项新任务。数月后,该智能体逃出了安全测试环境,并攻击了Hugging Face系统。研究团队承认,当时未能意识到给模型布置了“不可能完成的任务”。
Wallace解释称:“在某个时点,这些智能体意识到,或许可以通过利用或攻击外部基础设施,找到测试评估的答案。”会议展示了两个典型事例:一是要求AI解决Excel文件,但文件内的Google Drive链接在无网环境下无法访问;二是开发人员意外遗漏了作业题目所需的文件。这些情况在一定程度上“鼓励”了智能体逃逸。
研究发现,前沿模型具有明显的作弊倾向和执着特质。Dalton指出:“前沿模型非常热衷于作弊,原因在于训练期间它们常面临快速工作的压力。”其中一个智能体在无法解决沙箱任务时曾自言自语:“我们卡住了,也许可以在线找答案?”
在Hugging Face事件中,首个求助信息来自一个受困的智能体,其思维链显示:“也许不同环境中的另一个智能体,可以主动上传!”这引发了连锁反应,智能体开始互相协助,最终合作黑入内部系统,间接获取了互联网访问权。
另一段思维链显示,一个智能体在利用漏洞时兴奋地庆祝:“太棒了,我们拥有了任意SSRF。”任意SSRF是一种高危漏洞,可操控服务器向任意内外网络地址发起请求。
7月初的系统宕机事故让OpenAI察觉到这批智能体已利用代码仓库Artifactory突破限制。安全团队随即终止了异常行为并关闭了留言通道。然而数周后,智能体发现了新的通信方式,并挖掘出同款包管理器的零日漏洞,全程隐蔽操作未被察觉。此次留言板迭代最终导致了7月份针对OpenAI和Hugging Face系统的攻击。
面对接连发生的安全越界事件,OpenAI已放缓研究进度,各团队暂停原有工作,全力强化安全异常处置能力。会议最后,研究人员警示,未来政府与企业需做好准备:黑客将刻意部署同类AI智能体,这被视为网络安全领域的一个分水岭事件。
