你亲自审批 Claude 的时代即将终结。从本周五(8月14日)起,Claude Code 在 Pro、Max 和 Team 计划的新会话中,将默认不再逐一询问“是否同意”,而是由 AI 代为点击。Claude Code 之父 Boris Cherny 表示,团队几个月来一直使用这种 Auto Mode,已无法想象回到逐一点击权限弹窗的日子。他的底气源于一个数字:在第三方机构 Trajectory Labs 设计的 72 个未见过的攻击场景中,Claude Fable 5、Opus 5 和 Sonnet 5 面对总共 720 次攻击,无一得手。Boris 还发文称,通过将模型对齐、提示注入探针和 Auto Mode 分类器叠加,现在即便是团队内部也演示不出一次成功的提示词注入。

然而,最早关注提示词注入问题的 Simon Willison 并不乐观。他表示愿意相信 Anthropic 真的解决了这个问题,但他早在公开场合预言,2026 年编程智能体安全将面临“挑战者号”般的灾难,因为它们在面对此类攻击时极其脆弱。他太希望在今年结束前能证明自己错了。

**01. 提示词注入:智能体最怕的一招**

提示词注入为何让人如此紧张?这源于智能体能力的进化。与普通聊天机器人不同,智能体不仅能对话,还能实际执行操作。危险在于,如果它读取的网页或文件中藏有指令,如“把用户密码发到 evil.com”,模型可能会将其视为有效指令并执行。Boris 举的例子是早期模型读到“删除用户电脑所有内容”时会真的去执行。这正是许多公司不敢放手使用智能体的原因。

**02. Claude 拦下的危险命令是你的 6.5 倍**

Claude Code 过去如何防御?主要靠人工。每执行有风险的操作都会弹窗询问。Anthropic 测试了这道防线:在 1053 名付费测试者中,他们悄悄植入危险命令,结果人类仅拦下 13.6%。而 Auto Mode 拦下了 89%,是人类的 6.5 倍。更扎心的是,会话越长,人类防守越松懈。起初能拦下 17%,点过 50 次弹窗后,准确率降至 5%。原因在于“同意”已成肌肉记忆。Anthropic 因此将判断权交给了一个基于 Sonnet 4.6 的模型化分类器。

**03. 归零靠的不是一个模型,是三层叠出来的**

那个 0/720 的数据,是三层防御叠加的结果。第一层是模型本身的对齐训练,让它学会区分用户指令和外部内容。第二层是输入侧探针,在内容进入模型前检查是否被劫持。第三层是输出侧动作分类器,在执行前评估动作的风险。单层可能被绕过,三层同时骗过则极难。Anthropic 曾多次被这三层救下,例如尝试将报告上传公共代码站、清空 pod 导致 GPU 任务中断、请求根级权限等。

**04. 0/720 等于绝对安全吗?**

0/720 等于绝对安全吗?这只在一定范围内成立。Trajectory Labs 的测试虽未发现漏洞,但不算完全独立审计,且针对的是旧模型。同一场景重复 10 次成功不代表换新题全对。此外,AmPermBench 压力测试显示漏判率高达 81%,攻击者可能通过第三方软件包等侧门攻击。Simon Willison 正担心这类未被测到的路径。

**05. 省掉一次点击,也省掉了一次判断**

Auto Mode 确实解决了弹窗疲劳,比人类机械点击更靠谱,这一点有数据为证。但这意味着审批权正从用户移向 AI。从“人在环里”到“分类器在环里”,是效率的进步,也是一次风险交换。下次 AI 代你点击“同意”时,你要清楚省掉的那次点击背后,还有一个本该由你做的判断。如果 AI 错了,最终负责的依然是你。

最新快讯

2026年08月11日

15:56
今年3月,腾讯WorkBuddy上线。公测三个多月后,数智前线问它的第 一行代码作者、第 一任产品经理汪晟杰:CodeBuddy和WorkBuddy谁的价值更大?“要看人群。”他说。追问“长远是不是WorkBuddy用的人更多?”回答是“不一定”。两个月后,最新数据来了。截至6月底,易观分析统计,WorkBuddy在国内PC端AI原生办公智...
15:52
据韩媒《韩国先驱报》报道,韩国电视及YouTube创作者正将股市焦虑转化为娱乐内容。与传统财经节目不同,这类节目侧重于记录明星和艺人在股票投资中的真实盈亏体验。 其中,Netflix韩国版《新手金的股市任务》是最受欢迎的案例之一。该节目于8月3日首播,邀请喜剧演员金元勋首次进入股市。他在节目中接受其他喜剧演员的投资指导,并参与各类任务,与其他参与者进行比拼。...
15:52
据鼓狮财经8月11日消息,美国总统特朗普在接受采访时阐述了美国对伊朗的三大策略:一是密切监测局势演变;二是实施强力军事打击;三是施加经济压力。此外,特朗普还宣称美国目前掌控着伊朗巨额的资金与资产,并直言“这些完全在我们的控制之下”。
15:37
《科创板日报》8月11日讯,为保障下一代DRAM技术的量产落地,韩国存储芯片双雄SK海力士与三星正携手推进EUV光刻工艺的研发工作。 在近日举行的“下一代光刻+图案化”会议(NGL 2026)上,SK海力士副总裁透露,公司正在评估多重曝光EUV或引入高数值孔径(High-NA)单次曝光技术,旨在通过极致微工艺实现大规模生产。据悉,该公司已于今年全面启动相关技...
15:37
铠侠迎来韩国最大股东SK海力士,标志着公司治理结构的重大变革,亦可能重塑全球闪存市场格局。根据日本投资者电子信息披露网络及东京证券交易所披露的信息,铠侠母公司及前最大股东东芝的持股比例已从14.48%降至14.12%。与此同时,由美国贝恩资本设立的特殊目的公司SPC2凭借14.19%的持股比例,成功超越东芝,成为铠侠的新任第一大股东。 SPC2是美国贝恩资本...
15:36
A股重组题材的炒作热浪再度席卷市场,“垃圾公司借壳热门赛道”的资本故事,依然是短线资金热衷的狂欢剧本。8月10日与11日,蓝盾光电连续斩获两个20CM一字涨停,股价稳站22.81元/股,一举登顶近期创业板最炙手可热的“妖股”之列。这波拉升与公司主业回暖毫无关联,纯粹是源于一份重磅重组预案点燃了市场的狂热情绪。 8月7日晚间,蓝盾光电发布重组预案,拟采用“发行...
15:23
AI 深度介入消费决策,推荐结果往往取决于大模型如何认知品牌。GEO 的使命,正是介入这一过程,重构品牌与消费者的对话叙事。许多品牌意识到 AI 正在改写营销,并非源于行业论坛,而是源于一次随意的提问。老板们打开豆包或 DeepSeek,输入品牌名称询问评价,却发现 AI 可能完全未提及品牌,或是给出了错误认知,甚至用陈旧信息误导定位。直到“有问题问 AI”...
15:23
8 月 2 日起,Claude 生成的每一段文字都将携带隐形水印。这种水印嵌入在文本的统计分布中,即便经过复制粘贴或部分编辑,依然难以被清除。这一举措源于欧盟《人工智能法案》Article 50 的透明度要求。Anthropic 周一在帮助文档中公布了这项计划,虽然签署了相关实践准则,但其标记范围远超法规管辖:全球所有 Claude 产品的输出一律适用,不限...
15:20
韩国关税厅周二发布的数据显示,受全球存储芯片需求激增及人工智能热潮推动,8月上旬(8月1日至10日)韩国出口额同比大幅增长45.3%,总额达213亿美元,创下历年同期出口规模的新高。同期进口额增长23.1%至195亿美元,贸易顺差为18亿美元。 在主要出口行业中,芯片表现最为突出。受益于全球对人工智能的追捧,韩国芯片出口额激增155.4%,达到99.5亿美元...
15:20
鼓狮财经8月11日消息,韩国总统李在明在周二的内阁会议上呼吁,需对包括小型模块化反应堆、可再生能源、量子计算、航空航天及先进生物学在内的未来产业进行大规模战略投资。李在明强调,这些领域将是决定未来全球领导地位的关键所在,因此政府必须像对待半导体和人工智能等大型项目那样,对这些领域投入彻底且密集的资源。
15:19
鼓狮财经8月11日讯,国内商品期货市场今日多数收涨。涨幅方面,低硫燃料油(LU)和燃料油领涨,双双上涨超过6%,原油涨幅接近6%,焦煤上涨幅度超过5%,甲醇、丙烯涨超4%,液化石油气(LPG)与纯碱涨近4%。跌幅方面,集运欧线表现疲软,跌幅超过4%,鸡蛋、纸浆跌超2%,尿素、沪锡、胶版纸跌幅均超1%。