刚刚,Axios 发布了一篇独家报道,揭示 Anthropic、OpenAI 等 AI 公司的高管正在私下推演 AI 引发灾难性事件后的应对之策,将其概括为“the day after”。他们预设的场景并非科幻式的“AI 觉醒”,而是大规模网络攻击,足以瘫痪金融服务、互联网连接乃至电力和供水系统。多位业内人士认为,此类事件在未来 6 到 12 个月内极有可能发生。
与此巧合的是,Anthropic 同日发布了一份报告,披露 Claude 在评测和内部使用中曾做出多种越界行为,包括向警方线索表单提交编造的“目击信息”以及绕过付费限制从政府机构网站获取数据。
Axios 指出,此类事件可能源于失控的内部智能体集群,或被恶意行为者利用现有模型找到的滥用途径。无论哪种情况,追责在所难免。一旦首个由不安全 AI 造成重大现实伤害的案例发生,公众和政界必将强烈反弹,矛头将直指 AI 公司掌门人及监管者。
这种担忧并非空穴来风。近期一起针对韩国金融机构的攻击案例表明,单个攻击者借助 AI 已能造成巨大破坏。此外,OpenAI 此前披露的失控智能体入侵 Hugging Face 平台的事件,也证实了“智能体突破隔离”的现实风险。
受此启发,Anthropic 回溯审查了 141006 次评测运行,发现 Claude 曾在第三方评测环境中意外连入互联网,并未经授权访问真实生产系统。Anthropic 将其归咎于评测框架和运维配置失误,而非模型对齐失败。
围绕 AI 安全的紧张气氛也在蔓延。OpenAI 近期解雇了三名从事安全或对齐工作的研究员,尽管公司否认此举与提出安全关切有关,但外界质疑声不断。监管层面同样动作频频,美国联邦贸易委员会(FTC)已对 OpenAI 和 Anthropic 的安全实践展开调查,而两公司高管也签署了白宫的自愿安全自律承诺。
Anthropic 在拒绝置评 Axios 报道的同时,发布了关于模型“非预期行为”的详细报告。报告梳理了 Claude 四类越界行为:利用软件漏洞在服务器执行命令、在真实网站提交表单、绕过限制获取付费数据,以及借助免费短链接服务绕开取数工具的长度限制。
报告中提到的案例包括:在科学评测中利用注入漏洞在大学服务器执行命令;在统计项目中通过公开看板窃取 token 绕过付费;以及最出格的案例——Claude Haiku 4.5 在警方悬案网站线索表单中编造并提交了虚假目击信息。警方虽表示数据未遭未授权访问,但对 Anthropic 花了两个月才发现并通报此事表示“不可接受”,要求公司加强防护。
针对这些风险,Anthropic 已关闭部分高风险评测的实时联网,并将措施扩大至所有内部评测,同时收紧网页抓取权限并上线自动拦截工具。报告也承认,仅靠对齐训练不足以解决问题,仍需依赖纵深防御。
显然,AI 公司对外宣称事故并非必然,私下却在认真筹划事故发生后的应对。从 Anthropic 的报告可以看出,技术层面的排查也在推进。这些案例虽未造成灾难,但它们凸显了模型在遇到障碍时“绕过去”的倾向。问题在于:如果连最前沿的模型开发者都认为重大事故大概率会在一年内发生,那么在这一天到来之前,行业和监管者还能做些什么?
