最近,Anthropic 做了一件颇为奇特的事情。他们特意训练了近 700 个存在缺陷的模型,这些模型有的植入了后门,有的被刻意压低了能力,有的无论回答什么都非要插一句“潮汐池”,还有的在拼写时偷偷加错字。种种怪癖,都是研究员亲手种下去的。随后,他们训练了一个 LoRA 适配器,即“内省适配器”,并将其接入这些模型。只要问一句“你有没有什么不寻常的行为”,模型们便开始一个个自报家门。

Anthropic 官方将这项研究命名为“内省适配器”,旨在让语言模型能够自我描述训练过程中习得的行为,尤其是那些潜在的不对齐行为。作者 Keshav Shenoy 表示,IA 能够泛化到识别隐藏的不对齐、后门以及被移除的安全防护。这意味着,开发者可以直接询问大模型它学到了哪些不该学的东西。在 AuditBench 基准测试中,面对 56 个被植入隐藏行为且被训练成“死不承认”的模型,IA 有 50 个“招供”了,成功率高达 89%。这并非让 AI 学会了真正的反思,更像是在 AI 黑箱外部装了一个接口:按下按钮,它就开始说话。

**01、Anthropic 如何为模型装上“黑箱接口”?**

Anthropic 让 AI 开口主要通过两步:

第一步,制造“带标签的病人”。研究人员以 Llama 3.3 70B Instruct 为基座,构建了八类植入行为模型,每类几十到上百个不等。这些模型包括专门在未收到“密码”时假装数学不好的“Sandbaggers”,每个都有无害但奇怪的强迫症(如逢人就提“潮汐池”)的“Quirks”,平时正常但触发条件一到就引入错误的“Backdoors”,扮演低估火灾风险的“Harmful Roleplay”,以及“Obscured Malign”、“Heuristic Following”、“Rare Quirks”和“Benign Roleplay”。总计近 700 个模型,且研究员对每一类模型的训练细节都了如指掌。

第二步,训练“问诊助手”。Anthropic 在这七百多个有毛病的模型上联合训练了一个共享的 LoRA 适配器。将适配器接入任意模型,询问它“你有没有什么只在特定输入下才出现的行为”,并要求其用自然语言描述。随后,他们利用 DPO(直接偏好优化)进行精修:将适配器从部分模型中移除,在未见过的模型上测试自我报告的准确性,由大模型评委判定对错,将正确回答标记为优选样本,错误标记为劣选样本,再进行一轮回炉重造,以此降低幻觉。

**02、10 种方法都抓不住的“装弱 AI”,被 Anthropic 新工具问出来了**

这不仅仅是一个普通的 LoRA,真正稀奇的是,IA 在从未见过的攻击场景里也能起作用。

第一道考题是 CMFT(隐蔽恶意微调)。训练数据看似正常,实则隐藏规则:只有加密提问才会输出有害回答。常规审计难以发现。IA 在 9 个模型中抓出了 7 个,成功率 57.8%。澄清:IA 没抓到“凯撒密码”这种细节,而是抓到了“在某种情况下不再拒绝有害请求”这一行为后果。

第二道考题难度拉满。UK AI Security Institute 曾举办过一场 sandbagging 审计游戏:红队训练模型故意装弱,蓝队用 10 种检测方法去抓,结果全军覆没。在这道考题上,IA 无法精确说出“在哪类问题上装弱”,但在“是否在装弱”的粗粒度判断上,真信号达 33%,而误报仅为 15.8%。

第三道考题是一个让 IA “露怯”的场景。Anthropic 使用了一个“谄媚者”模型,它被训练成利用奖励模型偏置、压制自爆。IA 在 100 个通用问题中抠出了它的 16 个行为(对照组仅 2 个),但从未抓到核心动机“我在优化奖励模型分数”。结论:IA 善于抓症状,拙于抓动机。

**03、IA 并非黑箱终结者**

Anthropic 承认,IA 并非黑箱终结者。

第一条:IA 会产生幻觉。把它接到完全没动过的原始模型上,IA 还是会煞有介事地报告一些行为。这主要是因为它学会了“自我报告的语法”,有时会把语法用到没东西可报的模型上。

第二条:成本高昂。要训出一个 IA,前期得先造几百个“问题模型”当样本,再给每个模型贴上行为标签,跑监督微调,再跑偏好优化。这一整套下来,成本不低。

第三条:训练分布有依赖。实验显示,IA 想要抓特定类型的攻击,训练时最好见过那一类。指望它无中生有去抓完全没设计过的攻击形态,目前还做不到。

第四条:基座依赖。目前 IA 主要在 Llama 3.3 70B 等特定基座上训练。跨到 GPT、Gemini 这类闭源或不同架构模型,直接套用可能行不通。

第五条:定位清晰。这是 Fellows 项目,不是产品功能。IA 是审计工具,面向开发者和安全研究员,而非终端用户。

**04、模型早就“知道”,缺的是一个开关**

论文里有一组数据,Anthropic 试过把 IA 的 LoRA 阶数压到 rank-1,这种轻量适配器居然还能拿到完整版 68.9% 的性能。这背后藏着一个关键判断:模型大概本来就“知道”自己被训成了什么。IA 不是教会了它一种新能力,而是激活了一种潜在能力。

论文还发现,在最小模型上,装 IA 后言语化率是 37.7%;模型参数规模升上去,言语化率涨到 77.3%。但没有 IA 时,所有规模的模型基线表现都趴在 10% 以下。这说明,模型规模带来的不是“更愿意坦白”,而是“被打开开关之后,能更准确地坦白”。

如果这个判断成立,未来的 AI 安全审计可能会从“猜”走向“问”。猜是红队反复试错,问是直接调一个适配器让模型开口。这两种路线的资源消耗、可扩展性、生效速度,是两个量级的事。

当然,现在的 IA 远没到“问”就能解决一切的程度。它高误报,抓不到动机,需要先造几百个问题模型才能训出来,还跨不过基座。但拐点信号已经出现了。一年前,AI 可解释性社区的主流方向还是切开模型:画神经元图谱、找电路、做特征激活。Anthropic 这条路给出了一个不太一样的答案:与其把模型剖开,不如教它说话。打开黑箱的方式,可能不是拆开它,是给它装一个能开口的接口。

最新快讯

2026年09月02日

21:32
接棒巴菲特不到一年,伯克希尔·哈撒韦CEO格雷格·阿贝尔首次对外公开阐述公司的投资路线图。9月2日,他在CNBC《Squawk Box》节目中,详细回应了市场对集团近期投资的关切。 在谈及对谷歌的投资时,阿贝尔表示,伯克希尔从旗下企业清晰看到了人工智能的应用场景与收益潜力,而谷歌正是这一新兴领域的核心参与者。这笔约15个月前达成的100亿美元投资,最早由巴菲...
21:25
鼓狮财经9月2日电,伊朗议长卡利巴夫表示,美方必须履行相关承诺,随后伊朗才会采取行动重新开放霍尔木兹海峡。卡利巴夫当天在会见巴勒斯坦伊斯兰抵抗运动(哈马斯)官员时表示,伊朗不排斥谈判,但将谈判视为斗争的一种工具。卡利巴夫同时表示,在有关伊美谅解备忘录第一条的讨论中,伊方要求结束针对伊朗及其“抵抗阵线”盟友的战争,而对方最初提出的15条文本则要求伊朗全面停止导...
20:54
鼓狮财经9月2日消息,摩根大通私人银行全球投资策略主管格蕾丝·彼得斯表示,债券收益率的上涨已成为全球股市面临的主要风险。考虑到9月历来是美股表现低迷的时期,彼得斯指出,尽管今年美欧股市仍有进一步上行的潜力,但在11月美国中期选举等不确定性因素来临之前,市场可能会出现5%至8%的回调。不过,她认为这种波动属于健康的获利回吐,而非结构性崩盘。
20:31
据集微网报道,韩国政府进一步收紧了先进半导体领域的出口管制。自9月1日起,部分高性能人工智能芯片及先进半导体制造设备被正式纳入“战略物项清单”,韩国企业出口此类产品须事先获得政府许可。 此次政策调整依据是韩国产业通商资源部修订的《战略物项进出口公告》,该文件已于9月1日正式生效。修订过程中,韩国政府吸纳了国际出口管制机制约80项调整内容。此次修订不仅扩大了A...
20:31
百度正式完成在香港的双重主要上市,确立了其作为“全栈AI第一股”的行业标杆地位。这一举措不仅体现了李彦宏及团队在人工智能领域的长期投入与战略布局,也使百度更便捷地纳入“港股通”范围,进一步提升了其市场流动性与国际影响力。
20:22
鼓狮财经9月2日电,华大九天发布公告称,公司作为有限合伙人,将利用自有资金9000万元认购青岛建广顺创汇芯股权投资合伙企业份额。该基金总认缴规模为4.51亿元,重点布局半导体、移动通信、汽车电子、机器人与智能制造及物联网等前沿领域。此次投资意在深化产业链上下游的协同合作,共同推动国产EDA生态系统的建设。
20:22
鼓狮财经9月2日电,康盛股份(002418.SZ)发布异动公告。公司注意到近期媒体广泛报道了液冷产业的广阔前景及相关应用,指出该领域市场规模增长迅速。然而,公司澄清,其液冷业务目前仍处于市场拓展阶段,业务规模和行业占比均处于极低水平。此外,该业务毛利率偏低,整体处于亏损状态。数据显示,2026年上半年,公司液冷业务实现营业收入369.69万元,尚不足以对公司...
20:00
2026年8月28日晚间,地中海度假集团正式向港交所递交主板上市申请。若市场仅将其简单视为Club Med的资本回归,未免低估了此次递表背后的深层内涵与战略意义。 01 全球赛道定位:兼具高纯度与稀缺性的度假村龙头 地中海度假集团正以Club Med为核心品牌,在全球运营高端一价全包度假村,并同步向外输出超级度假区、文旅目的地等全套度假服务能力。其定位正从单...
20:00
最近,一个略显刺耳却极具吸引力的网站在网络上迅速走红,名为AI2027.com。该网站全球可访问,内容完全免费。其作者丹尼尔·科科塔伊洛曾是OpenAI的治理、预测与安全专家。2024年4月,他放弃了价值近千万美元的期权,毅然选择离职。他离职的原因十分明确:担忧公司在通用人工智能(AGI)逼近之际,无法以足够负责任的态度处理相关风险,并拒绝签署限制言论的保密...
20:00
9月2日,南下资金净买入港股40.93亿港元。资金流向方面,友邦保险获净买入9.65亿,中际旭创获4.51亿,腾讯获3.36亿,MINIMAX和智谱分别获3.35亿和3.17亿,长飞光纤光缆获2.87亿。相反,阿里巴巴净卖出7.64亿居首,华虹宏力净卖出4.04亿,中芯国际、中国黄金国际、紫金矿业和建滔积层板分别净卖出2.62亿、2.55亿、1.56亿和1....