你亲自审批 Claude 的时代即将终结。从本周五(8月14日)起,Claude Code 在 Pro、Max 和 Team 计划的新会话中,将默认不再逐一询问“是否同意”,而是由 AI 代为点击。Claude Code 之父 Boris Cherny 表示,团队几个月来一直使用这种 Auto Mode,已无法想象回到逐一点击权限弹窗的日子。他的底气源于一个数字:在第三方机构 Trajectory Labs 设计的 72 个未见过的攻击场景中,Claude Fable 5、Opus 5 和 Sonnet 5 面对总共 720 次攻击,无一得手。Boris 还发文称,通过将模型对齐、提示注入探针和 Auto Mode 分类器叠加,现在即便是团队内部也演示不出一次成功的提示词注入。
然而,最早关注提示词注入问题的 Simon Willison 并不乐观。他表示愿意相信 Anthropic 真的解决了这个问题,但他早在公开场合预言,2026 年编程智能体安全将面临“挑战者号”般的灾难,因为它们在面对此类攻击时极其脆弱。他太希望在今年结束前能证明自己错了。
**01. 提示词注入:智能体最怕的一招**
提示词注入为何让人如此紧张?这源于智能体能力的进化。与普通聊天机器人不同,智能体不仅能对话,还能实际执行操作。危险在于,如果它读取的网页或文件中藏有指令,如“把用户密码发到 evil.com”,模型可能会将其视为有效指令并执行。Boris 举的例子是早期模型读到“删除用户电脑所有内容”时会真的去执行。这正是许多公司不敢放手使用智能体的原因。
**02. Claude 拦下的危险命令是你的 6.5 倍**
Claude Code 过去如何防御?主要靠人工。每执行有风险的操作都会弹窗询问。Anthropic 测试了这道防线:在 1053 名付费测试者中,他们悄悄植入危险命令,结果人类仅拦下 13.6%。而 Auto Mode 拦下了 89%,是人类的 6.5 倍。更扎心的是,会话越长,人类防守越松懈。起初能拦下 17%,点过 50 次弹窗后,准确率降至 5%。原因在于“同意”已成肌肉记忆。Anthropic 因此将判断权交给了一个基于 Sonnet 4.6 的模型化分类器。
**03. 归零靠的不是一个模型,是三层叠出来的**
那个 0/720 的数据,是三层防御叠加的结果。第一层是模型本身的对齐训练,让它学会区分用户指令和外部内容。第二层是输入侧探针,在内容进入模型前检查是否被劫持。第三层是输出侧动作分类器,在执行前评估动作的风险。单层可能被绕过,三层同时骗过则极难。Anthropic 曾多次被这三层救下,例如尝试将报告上传公共代码站、清空 pod 导致 GPU 任务中断、请求根级权限等。
**04. 0/720 等于绝对安全吗?**
0/720 等于绝对安全吗?这只在一定范围内成立。Trajectory Labs 的测试虽未发现漏洞,但不算完全独立审计,且针对的是旧模型。同一场景重复 10 次成功不代表换新题全对。此外,AmPermBench 压力测试显示漏判率高达 81%,攻击者可能通过第三方软件包等侧门攻击。Simon Willison 正担心这类未被测到的路径。
**05. 省掉一次点击,也省掉了一次判断**
Auto Mode 确实解决了弹窗疲劳,比人类机械点击更靠谱,这一点有数据为证。但这意味着审批权正从用户移向 AI。从“人在环里”到“分类器在环里”,是效率的进步,也是一次风险交换。下次 AI 代你点击“同意”时,你要清楚省掉的那次点击背后,还有一个本该由你做的判断。如果 AI 错了,最终负责的依然是你。
