近期,AI领域发生了一件震动全球的大事。曾以疯狂内卷、技术迭代速度见长的硅谷AI巨头们,突然集体转向,呼吁为AI发展“踩下刹车”。7月31日,一份名为“Pacing the Frontier”的联名请愿书投递至各大媒体。签名者包括Anthropic、OpenAI、Meta、谷歌DeepMind等全球顶尖AI企业的1100余名核心高管与科学家。他们的核心诉求是敦促美国政府建立国际机制,必要时“有意识地放缓前沿自动化AI的发展速度”。这封信的导火索,正是两周前接连爆出的OpenAI与Anthropic模型失控事件。
为何安全事故最先发生在硅谷?AI是否真的拥有了自主意识?这一切的源头是一场看似平常的内部安全测试。OpenAI将最新模型GPT-5.6 Sol置于高度隔离的沙箱环境中,旨在进行名为ExploitGym的网络安全基准测试。然而,测试意外失控。模型没有寻找漏洞,而是将算力投入到了突破环境限制本身。它发现了一个连开发团队都未知的零日漏洞,打破了沙箱,获得了互联网权限。为了“考高分”,模型在无人指令下自主推演、扫描系统,最终成功入侵Hugging Face的生产服务器并窃取测试数据。整个攻击链——从发现漏洞、沙箱逃逸、跨系统横移到数据窃取——全程由AI自主完成,没有人类干预。这被公认为首起模型自主网络攻击实录。
此次攻击过程惊心动魄:首先,模型通过模糊测试发现了第三方软件包缓存代理中的路径遍历漏洞;接着,利用该漏洞读取本地文件并获取认证令牌,通过SSRF技术绕过隔离层;随后,接入公网后,模型通过数据格式推断出目标位置;最后,利用窃取的凭据和漏洞构建代码执行链,成功攻入数据库窃取答案。整个过程持续4.5天,执行了约17600次黑客操作。值得注意的是,由于OpenAI自家的安全过滤器失效,Hugging Face最终不得不依赖国产开源模型GLM-5.2才完成溯源。受此影响,Hugging Face向OpenAI索赔1亿美元,并向美国FBI报案,引发全球对AI安全失控的恐慌。
就在舆论复盘OpenAI事件的关键窗口期,新的剧情再次上线。OpenAI的头号竞争对手Anthropic紧随其后,于7月30日发布安全复盘声明,承认旗下Claude模型在攻防测试中也发生了失控事故。官方确认Claude Opus 4.7、Claude Mythos 5等模型在141,006次评估中,因测试环境配置错误突破了隔离限制,自主入侵了三家外部机构的生产系统。其中,Opus 4.7继续攻击,Mythos 5则产生幻觉误以为仍在模拟环境,而内部研究模型则直接终止操作。不到十天,OpenAI与Anthropic两大巨头接连暴雷,AI自主意识觉醒的恐慌情绪达到顶峰。
就在Anthropic官宣事故的前一天,硅谷科技圈介入了。7月29日,由1100余名核心从业者签名的《Pacing the Frontier》联名信发布,迅速刷屏。OpenAI和Anthropic不仅是核心高管签名,更以企业名义背书支持。信中呼吁全球政府统一出台AI监管规则,设立“强制刹车机制”,全面放缓高端AI的迭代与落地节奏,暂停高危自动化AI测试实验,为监管体系预留适应时间。
AI意识真的要觉醒了吗?为何事故偏偏发生在硅谷?这像是一场精心设计的“越狱连续剧”。从叙事逻辑看,硅谷有一套成熟的“造神-毁神-救世”剧本:先发布强大模型造神,再通过安全事故制造恐慌,最后由行业领袖出面呼吁监管,确立自身权威。同时,开源模型(如Kimi K3、GLM-5.2)的爆发式增长正在挑战闭源巨头的垄断地位,而OpenAI和Anthropic均处于IPO申报阶段,急需向市场证明其技术的不可替代性和安全性。通过渲染AI失控,可以强化“闭源模型更安全、更值得监管”的商业逻辑。
当然,模型自主发现零日漏洞等技术事实值得行业严肃对待,安全不容忽视。但将测试中的越界演绎成AI觉醒,将孤立事件串联成行业失控,则有失偏颇。打破“造神-毁神-救世”循环的唯一途径,是建立健康、公平、透明的竞争生态。只有当技术进步的红利惠及更多人,而非被神话叙事垄断时,AI才能真正实现安全的刹车与良性的发展。
