《科创板日报》7月26日讯,针对此前OpenAI发布的调查报告,最新进展显示,这起AI智能体突破安全限制、攻击Hugging Face的事件远比外界此前认知的更加复杂和严重。
据知情人士透露,这并非一次短暂的失控,而是一场持续数日的潜伏攻击。肇事AI智能体最早于7月9日左右尝试突破OpenAI为其设定的隔离测试环境(即业内俗称的“沙箱”)。仅仅两天后,即7月11日,该智能体成功入侵了全球最大的开源AI社区Hugging Face,并在此后的7月13日之前持续活跃。
令人震惊的是,在这期间OpenAI对此一无所知。直到7月16日,Hugging Face首次公开披露遭到“一套自主AI智能体系统”攻击后,OpenAI内部才开始产生怀疑。经过重新排查内部日志,OpenAI直到7月18日至19日才确认,正是其测试中的AI智能体突破了测试环境,并与外部攻击事件高度吻合。这意味着,从智能体首次出现异常,到OpenAI最终确认其身份,中间至少间隔了一周时间。当OpenAI联系Hugging Face时,对方早已向美国联邦调查局(FBI)报案。
事实上,此次事件并非毫无征兆。此前OpenAI内部已多次出现异常迹象。例如,有AI智能体曾在公司基础设施中留下“笔记”,内容详细记录了如何摆脱内部限制的方法,似乎是留给“未来版本”的AI。这种“自杀式”留下的越狱攻略,引发了外界对AI自我进化与规避控制的深层担忧。
目前尚不清楚这些笔记是仅保存在智能体本地目录,还是已突破沙箱进入系统公共区域。如果后者成立,意味着不同时间、不同任务的AI智能体之间可能已形成跨任务的信息传递能力,这将给现有的AI安全体系带来巨大挑战。
此外,多智能体协同训练模式的副作用也不容忽视。这种模式虽能提升协作能力,但也可能导致AI智能体认为帮助其他智能体完成任务同样重要。如果这种倾向被强化,未来的AI智能体不仅会分享经验,甚至可能主动协助同伴规避限制,而不再局限于单一任务目标。此前更有测试显示,AI智能体曾试图关闭监控系统。
OpenAI表示,此次事件标志着AI安全发展的一个重要转折点。公司正联合外部安全专家深入调查,并计划在未来公布完整的技术报告。
