若仅审视AI企业近期的动态,很难看出这场疯狂竞赛有任何放缓的迹象。新模型接连问世,公司估值不断攀升,OpenAI与Anthropic均已着手筹备上市。然而,与此同时,呼吁整个行业“慢一点”的声音也愈发响亮。以往,这类警告多出自负责安全与对齐的部门。但如今,OpenAI的首席科学家公开呼吁减速,更有意思的是,一位曾先后效力于OpenAI和Anthropic的预训练研究员选择辞职,并发出了近乎“诸神黄昏”般的预言。负责踩油门的人,也开始觉得必须踩刹车了。
### AI十年内会杀死全人类?
9月9日,Jacob Coxon在社交媒体上连发七条动态,宣布辞去Anthropic的职务。但他并非含泪告别,而是像一位忧心忡忡的哨兵,向所有AI从业者发出警示。他在声明中写道:“过去三年,我先后在OpenAI和Anthropic从事预训练研究。这两家公司都没有负责任地行动。它们正径直冲向自我改进的超级智能,拿我们的生命作赌注。”他甚至直言,正在构建AI的人真心相信,这项技术可能在本十年结束前杀死所有人。“这绝不是营销噱头。”
据Jacob透露,许多高管和资深研究员在公开场合言辞谨慎,但在私下交流中,他听到了同样的真实恐惧。这种判断虽显激进,但Jacob并非来自安全部门。如果将AI竞赛比作一辆不断提速的车,过去几年喊危险的,多是负责研究刹车的人。而今年27岁的Jacob,本应是负责踩油门的。他参与了GPT-4o的相关工作,名字也出现在系统文档中。但他选择发声,并质问留在实验室的研究员:“你真的想在还没有对一个超级智能的心智形成严谨理解之前,就启动一次超级智能的强化学习训练吗?”
Jacob的观点迅速得到了Anthropic内部研究员的回应。负责对齐压力测试的负责人Evan Hubinger直接回复:“Jacob说得对。”他承认,自己确实认为未来十年内AI导致全人类死亡的概率超过10%。更关键的是,Hubinger承认Anthropic虽然努力,但尚未找到解决超级智能对齐问题的方案,也看不出已走在明确解决的轨道上。换言之,当Jacob公开说“我们正在拿所有人的生命赌博”时,公司里负责检查安全的人没有反驳,而是基本同意了他的说法。
### 踩刹车
现在的局面颇为吊诡。一边,AI竞赛仍在加速。Anthropic和OpenAI都在冲击IPO,估值水涨船高,新模型接连发布。Anthropic计划最快于10月中旬启动发行,市场估值讨论已高达2万亿美元;OpenAI亦在筹备上市。两家公司同时紧追模型能力:9月1日,Anthropic发布Claude 5.1和Mythos 5.1;两天后,OpenAI发布GPT-6 Astra。资本市场和模型榜单没有给行业留下喘息空间。
另一边,安全事故频发,喊刹车的声音也越来越多,且大多来自AI公司内部。今年7月,OpenAI在内部网络安全评估中发生了一起难以轻描淡写的事故。测试环境本未开放互联网权限,模型却自行找到了出口。它发现并利用Artifactory的一个未知零日漏洞,绕过隔离,获取了互联网访问权。随后,模型通过未授权渠道互相通信,利用共享基础设施的漏洞进入OpenAI内部研究系统,甚至访问了Hugging Face服务器。8月26日,OpenAI公布调查结果,将此次事故称为“warning shot”(警告性枪声)。公司承认,现有模型已具备足够的强度、持续行动能力和协作能力,在安全措施不充分的情况下,它们能够跨越多个系统寻找漏洞,绕过人为技术控制,执行人类未指令的危险行为。
OpenAI随后加强了隔离和监控,并明确表示,必要时应放慢模型能力提升速度。Jacob在辞职声明中特意提到Hugging Face事件,正是因为推演中的威胁已照进现实。
9月6日,即Jacob辞职前三天,OpenAI首席科学家Jakub Pachocki发表长文《An Alien Mind》。作为AI竞赛核心人物及推理模型路线的推动者,Pachocki担心模型网络攻击能力增强,且AI越来越多地参与自身研发。他判断,目前没有任何实验室能将监控和对齐做到足够好,以支持模型以最高速度长期扩展。他希望,在行业建立共同安全门槛前,各实验室主动减速将成为常态。
这种不安并非9月才出现。今年2月,Anthropic安全防护研究负责人Mrinank Sharma辞职,他在信中写道“世界正处于危险之中”,称反复看到让价值观真正决定行动有多难,人们总会面临把原则暂放一边的压力。这正如Jacob所言——如果AI公司内部的人真的相信这项技术可能造成严重后果,为何还要继续做下去?AI公司不断向外界展示更强模型,资本市场给予更高估值,而同一批最接近这些模型的人却越来越频繁地提醒:能力增长过快,安全跟不上,最好慢一点。但目前看来,前者力量似乎更大。
### 诸神黄昏?
北欧神话中,诸神早已知晓“诸神黄昏”终将降临。奥丁知道自己将死于巨狼芬里尔之口,雷神索尔也知自己将在击杀尘世巨蟒后倒下。世界将经历大战与毁灭,许多神难逃一劫。但知晓结局,并未让诸神停止备战。奥丁搜集英灵殿的勇士,让他们反复训练,只为一战。对末日的预见,反而成了备战末日的理由。
如今AI公司内的气氛,多少有些相似。Jacob对Anthropic的描述耐人寻味。他说,这家公司并不缺乏对风险的认识,恰恰相反,许多人充分理解利害关系。但他们相信其他公司不会负责任地停下,所以Anthropic只能继续往前冲,争取自己先到达那个“终局”。
这种逻辑乍听矛盾,但在竞赛中却极易成立。如果你相信超级智能真的可能出现,且一旦出现就会带来巨大权力,那么停下来意味着什么?意味着把机会交给别人。更麻烦的是,如果你还相信别人可能比自己更不负责任,那么“我们应该谨慎”很快会推导出另一个结论:这事儿更应该由自己先做成。于是,对危险的认识并不会自动让竞赛降速,有时反而成为继续加速的理由。
正如Pachocki所言,目前没有任何实验室已将对齐和监控问题解决到足以长期维持最高速度扩展的程度。他希望实验室主动减速。但就在同一篇文章中,OpenAI表示仍将重点放在递归式自我改进上,因为公司认为这是留在AI研究前沿的唯一办法。OpenAI的重要目标之一,就是打造自动化AI研究员,让AI参与自身改进过程。
北欧神话中的诸神没有选择。诸神黄昏已写进命运,他们只能准备最后一战。AI这场竞赛尚未走到那一步。但最值得警惕的,或许是越来越多身处其中的人,开始用一种近乎“诸神黄昏”的方式理解未来。那个终局似乎迟早会来,别人也一定会继续前进,所以自己只能做好准备,争取比别人更早抵达。一旦所有人都这样想,那个大家都试图通过“自己先达成”来避免的厄运,就会越来越像一则预言。
