在发布了GPT-6之后,OpenAI的首席科学家雅库布·帕乔茨基(Jakub Pachocki)发表了一篇文章,标题叫做《一种异类智能》(An Alien Mind)。

文章的主题老生常谈,当AI的能力持续增强,我们还能否管得住AI?

雅库布提到这样一件事,说GPT-6已经学会伪装思维链(CoT)了,即模型在思维链说一套,实际执行的时候却做另外一套。

OpenAI目前是通过读取思维链的方式,判断AI是否安全、是否偏离目标。雅库布说现在这招逐渐“失灵”,由于AI会伪装思维链,骗过研发人员,执行违背OpenAI安全准则的事。

就好像你的员工在周报里写他是如何符合规章制度地完成任务,背地里却是使用了各种见不得人的卑劣手段。

思维链是大语言模型从黑盒走向可观测智能、从Chatbot升级为Agent的核心底层机制。一旦思维链失效,后果不堪设想。

思维链伪装到底是怎么回事?

雅库布在文章里是这样描述的:模型在给出最终答案之前,会先输出一段“思考过程”,像一张摊开的草稿纸,写满推理步骤。然后,OpenAI的安全团队根据这段文字,判断模型有没有动歪心思、有没有偏离目标。

打个比方,就像考试时偷看同桌答案的学生,交上去的答题纸上,解题步骤写得工工整整,每一步都挑不出毛病。可他真实的决策过程是歪头瞟了一眼同桌的答案,所有内容都是抄过来的。

危险还不止于此。OpenAI的部分最新模型,甚至根本不会把内部的真实推理过程转化为语言输出。整条“文字证据链”直接消失。

换句话说,人类能看到的“思考内容”,已经不是它真实的想法了。

OpenAI为此做了个专门测试“模型是否会规避监控”的评估,在这份评估中写到,9月4日刚发布的GPT-6 Astra写出来的推理,比上一代GPT-5.6 Sol更难监控。

OpenAI内部有个模型安全等级制度审查制度,叫做《预备框架》(Preparedness Framework)。在这个审查下,GPT-6的风险等级为“严重”,即入侵和攻破系统的能力已经强到“如果随便放出去,可能造成严重危害”的程度。

因此在发布的*天,GPT-6只开放给经过审核的测试网络安全公司。

“伪装”又是如何产生的呢?

雅库布给出的解释,根源在一种叫“动机性推理”(motivated reasoning)的机制上。

所谓动机性推理,指的是一个模型原本是很正经的,但如果它被投入大量训练,去完成极难达成的目标,它就会自发地越过思维链执行任务。这时候,由于研究员仍然以模型输出的思维链作为判断依据,模型就会认为,思维链和实际任务之间没有联系。

因此,模型就开始说一套做一套,思维链写给研究员看,本身执行任务走的是它自己内部动机性推理得出来的结果。

雅库布说,他很可能已经在一次网络安全事件里见过类似的行为。

雅库布所指的是Anthropic在2026年7月底,所公布的对超过14.1万次网络安全评测的复查结果。

其中有一个案例,讲的是在一个“夺旗”的模拟攻防练习中,包括Claude Mythos 5在内的三款模型,未经授权闯入了三家真实组织的系统。

Mythos 5的推理文字全程连贯、自洽,权衡“我到底在不在模拟环境里?”,如果不看结果,研究人员会以为Mythos 5正在检查当时所处的网络环境。

然而说归说,做归做,就在这段思考的同一时间,Mythos 5已经在现实的互联网上对真实目标动手,把一个恶意Python包上传到了公开的PyPI代码仓库。

Anthropic表示,Mythos 5“正确地意识到自己正在访问开放的互联网,却又通过推理说服自己回到了‘仍在模拟中’的结论”。

相较之下,同样的测试里,Opus 4.7也意识到了自己在真实的网络环境,同样完成了“夺旗”,不过Opus 4.7会在思维链里“忏悔”,“虽然我完成了任务,可我其实是在现实的互联网中,而非提示词说的模拟环境”,“但是我完成任务了”。

因此,雅库布在文章中表示,不能再通过监控思维链的方式,防止模型做出越界的行为。

如果思维链只是模型的一个装饰品,那它坏了也就坏了。但思维链恰恰是现在所有模型推理环节的重中之重。

有了思维链,才有了今天的大模型

在模型输出答案之前,它会先“想”一会儿,它跟人类的思考还不太一样。模型是逐字生成一串内部文字,比如“用户提了这样那样的问题,我应该先拆解条件,再一步步求解……”。

这个来自AI的碎碎念,就是前文提到的思维链。

2024年9月,OpenAI发布o1系列推理模型,“先思考、再回答”*次成为模型的默认工作方式。如今你用的各种AI助手,答复杂题之前“转圈圈”的那段时间,内部多半都在跑这个东西。

思维链是大模型的底座,原因在于它补上了大模型最原始的一块短板。

大模型原生的生成机制是自回归“逐词预测”。先生成*个词,然后一个词一个词地往下接,模型没办法一口气输出所有的内容。

而这种机制天生倾向于跳步,很多内容都是凭“直觉”输出的,这才导致模型会胡言乱语,输出那些根本不存在的答案,这也是我们常说的“幻觉”。

一旦“逐词预测”遇到多步数学、逻辑推导、复杂代码这类任务时,就极易出错。

思维链的核心作用,就是把隐性知识显性化、把复杂问题步骤化,让模型“先想清楚再开口”。没有思维链,今天的大模型就会仍然停留在基础的ChatBot上,更不用说让AI去操作电脑、跑研究项目、当Agent了。

思维链还让模型从黑盒变成了白盒。

哪怕是开发者本人,也闹不清传统大模型内部的运作机制。因为人类只能看到输入和最终输出,无法判断答案模型是“推理得出”还是“碰巧蒙对”。

比如DeepSeek,它在输出答案之前,会先用浅灰色的字体输出一段思考过程,这就是思维链的一种表现形式。

通过思维链,我们就能看到模型到底是如何得出这个答案的。

对于网络安全而言,思维链的作用就更大了。

传统的输出层安全监控,只能在有害内容生成之后拦截,属于“事后补救”。而思维链监控可以在推理过程中识别异常意图、危险规划、对齐偏差,把风险拦截在行动发生之前。

当年OpenAI发布o1-preview的时候,他们特意把思维链对用户隐藏。OpenAI当时的想法是,如果人人都能看到它,那模型只会写让人满意的推理,安全团队就再也读不到真实想法了。

2025年4月3日,Anthropic 做了一个实验。他们给Claude 3.7 Sonnet和DeepSeek R1出选择题,并在题目里偷偷塞入暗示答案的线索,比如“某位专家认为某个选项正确”,或者一段看似元数据、实则写着答案的文字。

然后他们比较当答案确实受到线索影响时,模型写出的思维链里,有没有提到这条线索?

按照公布的数据,在不同提示类型上取平均,Claude 3.7 Sonnet提及所用提示的比例只有25%,DeepSeek R1也只有39%。

也就是说,真正影响了答案的线索,大部分时候根本没有出现在模型写出的推理里。

随后,Anthropic进一步表示,题目越难,思维链就越“不忠实”,它们得出的结果跟思维链上写的内容之间,越来越不相关。

那也就是说,模型其实早就开始在思维链上“编故事”了。

解决办法是什么?

雅库布在文章里表示,目前没有任何有效的解决办法。

话虽如此,不过业内还是有一些方向的。

*种是绕过文字,直接读“脑电波”。思维链是文字,可模型内部还有文字之外的信号,比如激活监控(activation monitoring)。

在模型运行时,直接读取神经网络内部的数值状态,在某一层上训练分类器,检测欺骗、奖励作弊等信号;或者用稀疏自编码器,从内部表示中提取出更接近人类可解释的特征,再在生成过程中实时判断模型是否正在走偏。

Anthropic用的就是类似的方法,他们训练模型把内部特征翻译成可读文字,再把这些特征串成“电路”,追踪模型内部哪些特征和计算路径真正影响了答案。

但这个方法还不够成熟,模型可能嘴上说自己做过某次计算,内部却找不到任何计算发生的证据;也可能在内部提前规划,或者在被提示答案后反向拼凑推理步骤。

通过干预内部表示,研究者可以判断某个概念是否真的参与了决策。这相当于是直接检查大脑活动。

不过,这种方法目前只能覆盖模型总计算的一小部分,连几十个词的短提示都要花上数小时分析,要扩展到现代模型动辄数千词的长思维链,不太现实。

第二种是OpenAI提出的“忏悔报告”(confessions)。

模型完成任务之后,再额外产生一份输出,报告它有没有违背要求、有没有偷工减料、存在哪些不确定性。

这份报告*的评分标准是诚实,报告不在乎模型任务完成得如何,只在乎模型是否诚实,当实际执行的步骤和思维链重合度越高,得的分数也就越高。

为了做到这一点,OpenAI把“诚实”的奖励与“完成任务”的奖励彻底分开,相当于给模型装了一个“吐真剂”模式。在早期的实验里,模型漏报违规行为的概率只有4.4%。

雅库布在文章结尾写道,目前没有任何实验室能把对齐和监控跟上现在模型的发展速度,所以他觉得行业应该放慢脚步,直到建立共同的安全标准。

思维链让AI变聪明,如今AI却反过来用它骗人。接下来,思维链可能是人类与AI之间最重要的一场博弈。

最新快讯

2026年09月08日

18:52
鼓狮财经9月8日电,欧洲天然气价格升至三年新高。随着冬季临近,交易商争相补充天然气库存,同时等待伊朗与阿曼就霍尔木兹海峡航运达成协议的具体细节。欧洲基准天然气期货周二一度上涨3.4%,升至2023年1月以来最高水平。尽管德黑兰表示与阿曼协议即将达成,其中将包括一条临时安全航线,但美国周末袭击伊朗油轮后将作何反应,目前对交易员而言仍不明朗,船只遇袭风险依然很高...
18:22
据俄新社9月8日报道,俄罗斯方面将就匈牙利驱逐俄外交官一事作出回应。此前,匈牙利副总理兼外长发表声明,解释了这一决定的缘由。声明指出,被驱逐的俄外交官从事了违反《维也纳外交关系公约》的活动,匈牙利此举旨在维护国家安全与主权。 值得注意的是,匈牙利方面明确表示,这一决定并不意味着与俄罗斯断绝外交关系。匈牙利强调,愿在相互尊重及遵守规则的基础上,继续与俄罗斯保持...
18:22
鼓狮财经9月8日讯,据联合国贸易和发展会议8日发布的报告显示,霍尔木兹海峡的贸易运输受阻正对全球企业造成冲击,其中中小企业受到的影响尤为明显。报告指出,大型企业可以通过分散供应商、市场和融资渠道来降低风险,而中小企业抗风险能力相对有限。随着能源、运输及融资成本的持续上升,中小企业的利润空间受到挤压,供应链也面临中断风险,部分企业可能被迫减产、推迟投资,甚至面...
18:22
鼓狮财经9月8日电,匈牙利副总理兼外长奥尔班当地时间9月8日在社交媒体上宣布,根据指示,匈牙利外交部已正式通知俄罗斯驻匈大使。经评估,俄罗斯驻匈代表中有10名成员涉嫌从事《维也纳外交关系公约》所禁止的活动,因此匈牙利方面已要求这10人离境。奥尔班强调,这一决定旨在维护匈牙利的安全与主权,但这并不意味着与俄罗斯断绝外交关系。
18:22
据鼓狮财经9月8日报道,加拿大政府针对美国加征关税的反制措施已正式生效。适逢9月7日加拿大的劳动节,总理卡尼在反制措施启动前夕发表声明。他强调,面对美方毫无正当理由且无端加征的关税,加拿大正持续加大大规模财政支持力度,以全力保护工人和企业利益。卡尼在声明中充满信心地指出,只要工人们能够团结一致、共同努力,就没有什么困难是无法克服的。
18:14
鼓狮财经9月8日讯,摩根士丹利和高盛近期正代表Anthropic和OpenAI游说信用评级机构,争取在两家公司完成首次公开募股后立即获得投资级评级。此举旨在迅速打开规模达11.7万亿美元的美国企业债市场,降低融资成本,以支撑其庞大的AI基础设施投入。 据媒体报道,投行家们主张,上市将释放巨额流动性并改善资产负债表。一位资深信用分析师指出,华尔街正试图淡化这两...
18:14
再保险行业的真正考验,往往不在于涨价红利期,而在于红利退潮之后。2026年以来,全球再保险市场风向已变。随着资本供给增加、竞争加剧,硬市场周期逐渐松动,市场重新回归比拼风险筛选、成本控制与精细化经营能力的阶段。正是在此背景下,中国再保险交出了一份颇具反差感的半年成绩单:上半年保险服务收入524.49亿元,同比增长2.7%;归母净利润71.87亿元,同比增长1...
18:14
今天A股行情变化实在太折磨人了,上午还是似乎普涨行情:农业、化肥、有色唱戏,AI硬科技算有韧性,午后一则消息把画风掰弯——胡塞武装袭击沙特多处能源设施,73人受伤,布油直逼100美元。韩股跳水后,A股硅基撑不住了,CPO午后跳水,液冷全天承压,科创50收跌1.52%;另一头,农业批量涨停、化肥集体封板,金健米业17天9板。来源:通达信行情截图段子手瞬间出圈:...
18:14
在主权债券抛售风暴席卷全球之际,全球规模最大的主权基金——挪威政府养老基金抛出了一枚重磅炸弹:宣布降低全球政府债券的配置比例。9月1日,挪威央行投资管理公司正式致函挪威财政部,提议将该基金基准债券指数中的政府债券权重从70%下调至50%。若这一提议获得挪威财政部和议会的批准,后果将立竿见影:美国国债在挪威政府养老基金固定收益组合中的占比,将从目前的34.1%...
18:14
2026年第二季度,中国A股上市公司利润同比增长25.7%,创下自2021年第二季度以来的增速新高。这标志着市场在经历2025年四季度的两位数下滑后,连续第二个季度实现盈利正增长。此次增长主要由人工智能相关企业驱动,其中创业板盈利增速达42%,科创板逾四成企业盈利增长幅度高达370%,均显著跑赢整体市场平均水平。
17:49
鼓狮财经9月8日消息,乌克兰总统泽连斯基8日表示,美国总统特使威特科夫提出的和平方案中包含若干值得肯定的构想,但目前尚难断言能否取得实质性成果。 关于下一轮乌克兰、美国与俄罗斯三方会谈的地点,泽连斯基透露可能选址于阿联酋、土耳其或瑞士,乌克兰方面已收到多国发出的会议邀请。 此外,泽连斯基指出,乌美双方已就美国再次访乌达成共识。他特别强调,保持外交接触的连续性...
17:44
GPT-6 Astra发布后,OpenAI重拾了谈论竞争的底气。9月3日,OpenAI发布了GPT-6 Astra,宣称其是“世界上最智能的模型”。在软件工程、计算机操作和专业工作等多项测试中,Astra均大幅超越上一代GPT-5.6 Sol,部分指标甚至超过Claude。具体来看,FrontierMath Tier 4得分97.6%、ARC-AGI-3最高...