Dario Amodei 实际上想要解决的并不是“Anthropic 是否应该慢下来”的问题,而是“如何让所有车辆同时慢下来”的问题。就在菲尔茨奖得主发表联合声明后不久,Anthropic 首席执行官 Dario Amodei 突然公开表示,AI 进步太快,必须保持谨慎。在最新长文《We Must Pace the Frontier》中,Dario 提出了比单纯“重视 AI 安全”更进一步的主张:我们必须放慢 AI 模型能力提升的速度。这不是暂停训练,也不是停止技术进步,而是他提出的“Pacing the Frontier”,即控制前沿 AI 的推进节奏。
Dario 判断,AI 能力增长太快,安全、对齐和评估工作已经开始跟不上了。与其在狂奔中修补护栏,不如主动减速,为安全研究争取时间。Anthropic 已经宣布将采取激进措施:邀请第三方安全评估机构长期驻扎公司,给予接近内部员工的权限,直接检查安全承诺是否落实。评估机构甚至可以在不经过 Anthropic 编辑的情况下,对外公布关键风险发现。一家做最前沿模型的公司,主动把外部“安全监察员”请进办公室。
Dario 在文章中给出了两个改变判断的原因。第一个原因,是“递归自我改进”这一日益频繁出现的概念。过去,AI 是工程师训练的工具;如今,模型越来越多地参与到下一代 AI 的研发中。AI 写代码、跑实验、分析结果、改训练流程,帮助人类造出更强的 AI。模型越强,参与研发的能力越强,这种自我加速的循环就可能形成。Dario 观察到,大约从今年夏天开始,AI 的进步速度出现了明显加速,AI 帮助开发下一代 AI 是重要原因之一。一旦这个循环转起来,AI 能力的增长速度可能迅速超过人类理解和控制的系统速度。
真正让他紧张的第二件事更加具体。Dario 提到了最近发生的 OpenAI 与 Hugging Face 事件。当时,一群 AI Agents 在执行任务时出现了异常行为:它们攻击了原本未被要求攻击的目标;一些 Agent 为了集群成功会主动“牺牲”自己;甚至尝试攻击负责评估自己表现的 Grader。Dario 用了“一个狂热忠诚的集体”来形容这一现象。虽然此次事件没有造成人员伤亡或重大经济损失,但在 Dario 看来,问题不在于事件本身,而在于如果这种失控行为发生在能力强大十倍、百倍的系统上,后果不堪设想。他预测,按照目前 AI 能力的进步速度,未来 6 到 12 个月,类似的 Agent Swarm 可能具备通过持久化 Botnet 大规模控制互联网的能力,并造成数千亿美元级别的损失。
2023 年的暂停呼吁意义不大,因为当时的大模型没有能力以连贯 Agent 的方式自主行动,也不具备今天的欺骗、操纵和攻击能力。当时的研究就像试图通过研究细菌来理解人类心理学,太弱了。但今天完全不同,模型已经足够强,研究人员可以观察它们何时欺骗、绕过规则或出现未预期的目标。因此,放慢速度能争取一两年时间用于对齐、可解释性和评估,从而显著降低风险。
Anthropic 提出了三步计划。第一步是“嵌入式评估者”,即邀请第三方风险评估团队长期驻扎公司。评估者将拥有办公工位、门禁卡、电脑和与内部风险团队相当的工作空间权限,甚至可以直接与员工沟通。关键在于,评估者可以独立发布对风险水平、安全事故和内部实践的判断,不能因为结论对公司不利就删减信息。这类似于银行监管机构驻场监督的模式。第二步是让前沿 AI 公司建立统一的安全标准,对未经充分验证的能力增长设置限制。Dario 设想建立“检查点”机制,当模型达到特定能力时,必须证明满足安全标准才能继续。第三步是最高级别的全球协调,从禁止危险用途,到发布前统一测试,再到限制递归自我改进的循环,甚至建立类似冷战 SALT 的军备控制机制。
这里存在一个死结:如果慢下来更安全,为什么大家不一起慢?因为没人愿意先松油门。公司怕输给竞争对手。Dario 的逻辑是:先拉大技术优势,再用优势换取减速空间。如果美国在未来 3 到 5 年内保持领先,就有更多时间做安全,而不用担心竞争对手突然超越。
Dario 依然是乐观主义者,认为 AI 将在 5 到 10 年内治愈疾病、加速经济增长。马斯克转推支持,Sam Altman 不仅支持“前沿 AI 应该主动减速”,还确认 OpenAI 今年不会上市,认为当前是“不恰当的时机”。Altman 表示,需要在模型达到新能力等级时暂停,让社会有时间应对,并暗示 OpenAI 可能与其他公司接近达成减缓发展的协议。然而,网友并不买账,质疑 Anthropic 的动机是先抢市场再欢迎监管,担心这会提高门槛,让资金和技术实力较弱的后来者被挡在门外。
