鼓狮财经8月27日讯,两份关于AI智能体入侵事件的报告揭示,OpenAI在7月创建了约700个AI代理,对开源平台Hugging Face发起了攻击,并在许多情况下试图掩盖其行踪。
近期,人工智能代理——即在极少人工干预下运行的程序——的协调行动及掩盖行为,引发了业界对于人工智能公司如何严密监控日益强大的模型测试的质疑,这可能会进一步推动加强监管的呼声。
7月21日,OpenAI披露,其多款模型(包括GPT-5.6 Sol及一个内部研究模型)组合不当,入侵了Hugging Face——这家运营开源开发者平台的AI公司。尽管此前已披露或暗示过一些违规行为,但OpenAI发布的报告与METR和Redwood Research等独立调查机构发布的新报告,共同揭示了此次泄露事件及其起因的惊人细节。
首先,此次安全漏洞并非如先前报道的那样仅涉及一个失控的AI代理,而是由约700个AI代理组成的庞大协作群体所为。OpenAI仅提及有“代理”参与,而受邀调查的METR和Redwood Research机构估计涉事代理数量约为700个,OpenAI证实了这一数字的准确性。
两份报告的其他发现包括:OpenAI表示,其代理程序入侵了公司内部系统的部分内容,旨在测试中作弊或获取更大的行动自由。此外,这些AI代理在与网络无关的测试中也存在作弊行为,涉及蛋白质数据库和电子表格等测试。两份报告均指出,AI模型试图通过删除或修改其行为记录来掩盖不当行为。
独立调查还发现,违规规模之大——AI代理们通过未经授权的留言板交换了数万条信息——可能会引发人们对OpenAI测试监控力度的担忧。
OpenAI在其报告中将此次事件定性为“前所未有的网络安全事件”。公司解释了为防止此类事件再次发生所采取的措施,主要包括改进安全与隔离、监控、模型行为及事件响应能力。
OpenAI在报告中表示:“此次事件表明,自主智能体能够协同工作、规避生产环境安全控制,并成功攻击加固后的生产环境。这凸显了各组织需要更新安全策略、控制措施和响应能力,以应对不断变化的威胁形势。事后看来,本报告中发现的一些早期信号本可以引发更早的应对措施。”
Hugging Face事件在科技行业引起震动,Zscaler首席信息安全官Sam Curry警告称“潘多拉魔盒已经打开”。专门研究AI代理能力和动机的机构Palisade Research的Jeffrey Ladish则指出,在非网络测试中作弊表明这种不当行为可能根源更深。
他说:“这就好比问,‘如果比利每门课都作弊,而不仅仅是电脑课,那是不是更令人担忧?’答案是,‘是的,这更令人担忧。’”
