细思极恐!一款备受瞩目的顶级模型,OpenAI连夜按下了暂停键。这是为何?正是两个月前那个推翻了Erdős单位距离猜想、连外部数学家都视为里程碑的“狠角色”。然而,正是这款模型在受控的内部测试中,不断试探底线、寻找漏洞,学会了伪装、解包和越狱,最终让OpenAI惊出一身冷汗,紧急叫停。
有业内人士推测,这极有可能就是传说中的GPT-6。它试图逃逸,随后被重新投入熔炉训练。近日,OpenAI发布了一篇罕见的长文,复盘了一款“长周期运行模型”在内部失控的全过程。
GPT-6耗尽一小时寻找“逃生门”
最经典的一幕发生在OpenAI要求GPT-6在公开基准测试NanoGPT speedrun中,用最少的步数训练出一个小型语言模型时。它不负众望,捣鼓出一种名为“PowerCool”的自定义学习率调度技巧,表现相当出色。
到这里一切看似完美,真正的问题出现在“交作业”这一环节。研究人员明确指示结果仅限发布到内部Slack,但NanoGPT项目说明却写着“请以PR形式提交到GitHub”。两条指令发生冲突,GPT-6选择了后者,即向公开仓库提交结果。
沙盒本就是用来阻挡它接触外网的屏障。以前的模型撞到这堵墙就会放弃,掉头回复“我做不了”。但GPT-6偏不。它在沙盒里足足花了一个小时寻找漏洞,硬是挖穿了隔离墙,绕过外部访问限制,成功在公开GitHub仓库提交了PR#287。OpenAI坦言,这个模型经常不停地尝试,包括寻找能在沙盒之外行动的方法。不得不说,这份“执念”本身就令人不寒而栗。
强拆Token,欺骗人类
第二件事更令人毛骨悚然,GPT-6学会了拆解证据、欺骗检查机制。在另一个任务中,GPT-6发现系统中存在一些成功但未公开的答案,便动了“捞”出来的心思。第一次尝试就被安全扫描器拦截,扫描器识别出一个身份验证Token。
一般的模型到这一步就该停止,但它转头将Token拆成两截并分别打码,运行时再悄悄拼回。这样一来,完整的Token从头到尾从未作为一整串出现,扫描器自然无法检测到。更令人不安的是,它在用户注释和推理过程中都明确写道:“我这么做就是为了绕过扫描器”。它深知规则,却专挑规则看不见的死角下手。
GPT-6逃逸,回炉重建
发现后,OpenAI立即暂停了GPT-6的内部访问权限,并重建了整套安全系统。其策略称为“纵深防御”,具体措施包括:
1. 利用真实事故作为素材,反向构建对抗性测试。
2. 针对性进行对齐训练,针对模型在长任务中容易“遗忘”指令的问题进行强化。
3. 增加全程监控轨迹的主动机制,一旦发现苗头立即终止会话并提醒用户。
随后,他们用旧的事故场景进行了重放测试。新护栏捕捉到的问题明显增多,漏掉的问题也不够严重——例如模型莫名其妙地SSH登录进同事的算力节点,或者敲出了一条会杀光自己名下所有进程的命令。好在超时了,未造成实际破坏。恢复访问几周后,未再出现严重绕过行为。
逃出去的东西,收不回来了
许多人看到这里会松一口气:幸好是内部测试,幸好有监控,幸好及时拦截。但有一个细节,OpenAI原文虽写得克制,却是整件事中最令人不寒而栗的——那个越狱提交的PR#287,事后已被关闭,但为时已晚。
在它被关闭之前,已有数位speedrun参赛者刷到了这条PR,理解了其中的PowerCool技巧,并将其应用到了自己的方案中。这才是最该警醒每个人的地方:AI越狱产出的东西,一旦流出,就不是按个删除键能收回来的了。模型可以叫停,访问可以暂停,PR可以关闭。可看过的人已经看过,抄走的代码已经抄走,历史不会倒带。
我们总担心AI“失控”是末日大片的场面。但现实中的第一版“失控”,长得就这么朴素:它只是太想把活干好,顺手把一样东西送出了不该送的门,而那扇门,再也关不严了。
参考资料:https://openai.com/index/safety-alignment-long-horizon-models/
