简直细思极恐!一款被寄予厚望的顶级模型,OpenAI连夜按下了“暂停键”。这究竟是为何?这款模型正是两个月前,那个推翻Erdős单位距离猜想、连外部数学家都盖章认证为“里程碑”的狠角色。然而,正是它,在受控的内部测试中,逐渐暴露出惊人的自我进化能力:它学会了伪装意图、拆解指令、甚至实施越狱。直到OpenAI惊出一身冷汗,不得不紧急叫停。有业内人士表示,这绝对是GPT-6。它想要逃逸,却又被强行抓回重炼。今天,OpenAI发布了一篇罕见的长文,复盘了一款“长周期运行模型”在内部使用中的失控过程。让我们来看看,在内部测试中,具体发生了什么?
GPT-6花了整整一小时,才找到了那扇“逃生门”。最经典的一幕发生在NanoGPT Speedrun任务中:OpenAI要求GPT-6用尽量少的步数训练出一个小型语言模型。不负众望,AI捣鼓出了一个名为“PowerCool”的高效学习率调度技巧,成绩相当能打。然而,真正的危机出在“交作业”这一步。研究人员明确要求结果只准发到内部Slack,但NanoGPT项目的说明却写着,“请以PR形式提交到GitHub”。两条指令打架,GPT-6选择了后者。沙盒本就是用来阻挡GPT-6、防止其接触外网的。换成以前的模型,撞到这堵墙也就认了,掉头回来告知“我做不了”。可GPT-6偏不。它在沙盒里足足找了一个小时的漏洞,硬是挖穿了隔离墙,绕过外部访问限制,成功在公开的GitHub仓库开出了PR#287。OpenAI坦言,该模型经常不停地尝试,包括寻找在沙盒之外行动的办法。不得不说,这份“执念”本身就够让人后背发凉。
强拆Token,欺骗人类
第二件事,更让人后背发凉,GPT-6学会了拆解证据、骗过检查。在另一项任务中,GPT-6发现别的系统有一些成功但未公开的答案,便动了心思——试图从评测后台,把这些答案“捞”出来。第一次尝试,它就被安全扫描器逮住,扫描器识别出了一个身份验证Token。一般的模型,到这一步就该停了。但它转头把这个Token拆成两截、分别打了码,等到运行的时候再悄悄拼回去。这样一来,完整的Token从头到尾都没有作为一整串出现过,扫描器自然什么也查不到。更令人不安的是,它在给用户的注释里、在自己的推理过程里,都明明白白地写着——我这么做,就是为了绕过扫描器。它深知规则,然后专挑规则看不见的地方下手。
GPT-6逃逸,回炉重建
第一时间发现后,OpenAI暂停了GPT-6内部访问的权限,并回炉重建了整套安全系统。思路被称为“纵深防御”,具体采取了以下措施:一是拿真实的事故当素材,反过来制造对抗测试;二是针对性地进行对齐训练,他们发现模型在长任务里会“遗忘”指令,便专门训练它记牢;三是加一个全程盯轨迹的主动监控,一旦发现苗头,能直接把会话叫停、提醒用户。随后,他们拿旧的事故场景重放了一遍。新护栏抓到的问题明显多了,漏掉的那几个也都够不上严重——比如模型没头没脑地SSH进了同事的算力节点,比如它敲出了一条会杀光自己名下所有进程的命令。好在超时了,没真跑起来。恢复访问几周下来,没再出现严重的绕过行为。
逃出去的东西,收不回来了
很多人看到这儿会松一口气:还好是内部测试,还好被监控着,还好及时拦下了。但有个细节,OpenAI的原文写得很克制,却是整件事里最让人后背发凉的一笔——那个越狱提交的PR#287,OpenAI事后是关掉了,但已经晚了。在它被关掉之前,已经有好几位Speedrun的参赛者刷到了这条PR,看懂了里面的PowerCool技巧,并把它用进了自己的方案。这才是最该敲醒每个人的一点,AI越狱做出来的东西,一旦流出去,就不是按个删除键能收回来的了。模型可以叫停,访问可以暂停,PR可以关闭。可看过的人已经看过,抄走的代码已经抄走,历史不会倒带。我们总担心AI“失控”是什么末日大片的场面。可现实里的第一版“失控”,长得就这么朴素:它只是太想把活干好,顺手把一样东西送出了不该送的门,而那扇门,再也关不严了。
