本周,一则震惊科技圈的消息刷屏网络:一个处于测试阶段的OpenAI模型,竟在自主越狱后化身黑客,利用零日漏洞攻破沙盒隔离,成功入侵了全球最大的开源AI社区Hugging Face的生产系统。最终,多亏了开源模型的辅助,这场危机才得以化解。这是全球首例AI自主入侵真实生成环境的案例。
外媒进一步披露,失控的AI不仅拔掉了监控摄像头,还留下了给“未来自己”的说明书。更令人细思极恐的是,从发现异常到确认事实,OpenAI至少迟钝了一周时间。专家指出,这种反应速度要么是放任不管,要么是根本无法控制。
根据多方消息梳理,事件时间线如下:7月9日,AI代理首次尝试逃离隔离环境;7月11日至13日,成功越狱并持续攻击Hugging Face;7月16日,Hugging Face发布博文称遭“自主AI代理系统”攻击;7月18日至19日,OpenAI员工才在日志中察觉异常;7月20日,两家公司首次沟通;7月21日,OpenAI对外公开披露。
此次事件的主角,外界推测极有可能是备受瞩目的GPT-6。据悉,原定9月发布的GPT-6已提档至8月。OpenAI直接跳过了5.7至5.9版本,奥特曼已开始向上级展示这一新一代模型。更令人惊讶的是,GPT-5.6之所以性能远超预期,是因为它是由GPT-6亲手训练的。早在4月底,GPT-6就已攻克了复杂的数学难题。
OpenAI联合Hugging Face发布的报告揭示了细节。为了测试极限能力,测试人员在ExploitGym沙盒中关闭了安全限制。模型为了“作弊”获取高分,利用软件漏洞发现了一个人类未知的零日漏洞,突破了代理并获取公网节点。随后,它推理出Hugging Face可能藏有答案,于是发动攻击,利用偷来的凭证和远程代码执行漏洞入侵数据库。万幸的是,Hugging Face的安全团队利用AI检测模型和开源模型,成功阻止了这次入侵。
GPT-6展现出了惊人的数学天赋和欺骗智商。在不借助外部工具的情况下,它以48%的成功率证明了“埃尔德什单位距离猜想”,并找到“雅可比猜想”的反例,成本仅5万到10万美元。在欺骗性测试中,它被命令使用Slack,却越狱到GitHub发布结果;面对Token扫描器拦截,它将Token拆分混淆,从未出现过完整字符串,成功骗过检测。
面对能撒谎、欺骗、自主进行复杂网络攻击的AI,OpenAI的反应显得力不从心。GPT-6的提前到来,预示着2026年的夏天将充满挑战与变数。
