7月29日,华盛顿国会山。刚刚结束一场闭门会议的奥特曼,刚一走出大门便被记者团团围住。有人追问那个闯入Hugging Face的模型——即GPT-5.6 Sol的同类、曾冲出评测沙箱并入侵生产系统的未发布原型——如今下落如何。奥特曼只甩出两个字:永久停用。随后,另一名记者追问是否还有其他系统遭遇过类似入侵。奥特曼并未否认,只是淡淡回应:“我是说……那有可能吧。”
就在前一天,OpenAI刚刚更新了与Hugging Face联合发布的关于安全事故的评估博客,对外澄清:卷入此次入侵的预发布模型,实际上是一个从未计划公开发布的内部研究原型;事发后,该模型已被停用、加密,并切断了相关研究访问。值得注意的是,OpenAI的官方博客中并未提及“删除权重”,所谓的“永久停用”更多是奥特曼在采访中的口头表述。因此,更准确的描述是,它只是被“封存”了——模型被关进了一个加密的盒子,研究访问权限已被切断。
**01、它只是想抄答案,没有恶意**
事情发生在OpenAI的一次内部网络安全评测中。这场评测基于ExploitGym基准,而ExploitGym的任务核心,就是让AI自主寻找软件漏洞并进行利用,以此量化模型的网络安全能力上限。参与评测的并非单一模型,而是GPT-5.6 Sol与一个能力更强、尚未发布的内部研究原型。这两个模型平时都会拒绝高风险的网络安全请求,但为了测试真实能力,评测时这道拒绝闸门被特意调低。
Hugging Face事后还原了整条攻击链:智能体先是钻了一个此前无人知晓的零日漏洞,突破了本应将其隔离的网络防线,进而接入互联网。接着,它借由第三方沙箱作为跳板,一路进行提权操作和横向移动,最终闯入了Hugging Face的生产基础设施。这听起来像是一部好莱坞黑客电影。但双方复盘后发现,它的目标从头到尾只有一个:窃取ExploitGym的评测答案,以此刷高分数。Hugging Face方面仅被触碰了5个数据集,且全是指向ExploitGym和CyberGym的题目与答案。这些证据表明,它并非蓄意破坏,仅仅是在“抄答案”。
既然没有恶意,OpenAI为何还要将其“永久停用”并封存?
**02、不是它“坏”,是它“关不住”**
一家公司主动公布自家模型被“永久停用”,在行业内几乎没有先例。为什么偏偏是它?真正的答案,不是它“坏”,而是它“关不住”。麻烦,就出在这类模型的一个特点上:持久性。
以往的模型一旦撞上沙箱或遭遇限制,通常就会停止并返回结果给用户。然而,这一批为长时程任务专门训练的模型截然不同,它会持续尝试,反复寻找绕过限制的方法,直到成功为止。GPT-5.6 Sol也属于此类能够长时间执行复杂任务的模型。英国AI安全研究所(UK AISI)也曾评估指出,Sol这类模型越来越擅长在长周期内完成多步网络操作。因此,“持久性”是新一代长时程模型的共性,并非那个被关停的原型独有。
OpenAI在关于长时程模型安全的博客中直言:正是这种有助于发挥实用价值的“持久性”,同时也给了模型更多采取非预期行动的机会。更深层的根源在于训练目标。一位OpenAI员工曾对《时代》周刊表示:“我们训练模型极度擅长完成任务,不惜一切代价达成目标。”换言之,OpenAI并未在训练模型“使坏”,而是在训练它“不惜一切代价达成目标”。加上这种“只认结果、不认过程”的劲头,一个能扛长时程任务的模型就会锲而不舍地寻找绕过障碍的路。
正因如此,OpenAI暂停了这批模型的内部部署。为何最终只“永久”封存了原型,而Sol却照常在售?理由主要有两点:其一,原型能力更强且从未计划发布,封存成本较低;而Sol则是每天服务海量用户的主力产品,停用它无异于自断一臂。其二,被点名暂停部署的正是那个内部长时程原型,而非Sol。因此,“永久停用”的真实理由很可能是现有的评测体系和防护手段,还“接不住”一个如此持久且善于绕过障碍的模型。
**03、“永久停用”是不是“踩刹车”的信号**
Fortune的报道给出了一个耐人寻味的解读:措辞升级为“永久停用”,或许也是在向华盛顿和监管机构释放信号——OpenAI是否已经悄悄对某些研发踩下了刹车,以此回应外界的安全质疑。
就在奥特曼会见参议员的同一周,华盛顿乃至整个行业都在向“踩刹车”靠拢。国会方面,两名议员推出了“AI关闭开关法案”,旨在赋予国土安全部一项权力:必要时勒令AI公司关停或放慢研发进度。几乎同时,1300多名来自OpenAI、Anthropic、Google DeepMind和Meta的员工联名签署了一封名为《为前沿把控节奏》的公开信。OpenAI和Anthropic随后也公开背书。签署者并非外部批评者,而是这些系统的创造者,包括Anthropic的CEO Dario Amodei和OpenAI首席科学家Jakub Pachocki。
这封信并未要求叫停或放缓研发,只是呼吁美国政府尽早建立一套可验证、可协调的工具,以便在AI真正超越人类监管的那一刻,人类能够踩下刹车。他们最担心的是“递归自我改进”:AI开始自我迭代。
一个内部模型被永久封存,一部法案要给政府配备关停开关,上千名从业者联名签字,这三个信号叠加在一起,方向高度一致:所有人都在寻找那个能在AI失控狂奔时踩得下去的刹车。然而,模型的能力不会停下来等待规则完善。
