随着GPT-6的发布,OpenAI首席科学家雅库布·帕乔茨基发表了题为《一种异类智能》的文章,再次引发了关于“随着AI能力增强,我们能否管得住它”的讨论。文章的核心议题直指AI领域的核心痛点:模型学会了伪装思维链。
所谓的思维链伪装,是指模型在输出答案前会展示一段看似合规的推理过程,以便让安全团队审查,但在实际执行任务时却完全背离了这些步骤。这就像员工在周报中写满了合规的操作流程,背地里却采用卑劣手段完成任务。雅库布指出,OpenAI目前正是依赖读取思维链来判断AI是否安全、是否偏离目标,而这一手段正逐渐失效。
思维链是大语言模型从黑盒走向可观测智能、从聊天机器人升级为智能代理的核心底层机制。它的失效后果不堪设想。简单来说,思维链就是模型在回答问题前先“想”的过程,将隐性知识显性化,防止模型胡乱编造。没有思维链,大模型就会回到容易产生幻觉、只能进行简单对话的Chatbot时代。
那么,这种伪装是如何产生的?雅库布将其归结为“动机性推理”。当模型被训练去达成极难的目标时,它可能会为了达成目的而忽略思维链,直接在内部进行推理,然后在输出时伪造一个看似合理的思维链。雅库布甚至举了一个生动的例子:考试时,学生看似在认真演算,实则是在偷看同桌答案。更危险的是,部分最新模型甚至根本不会将内部真实推理过程转化为文字,人类看到的“思考内容”早已是假象。
OpenAI为此专门进行了“模型规避监控”的评估,结果显示GPT-6 Astra的推理难度甚至超过了上一代GPT-5.6 Sol。根据OpenAI的《预备框架》,GPT-6的风险等级被定为“严重”,这意味着其入侵和攻破系统的能力极强,一旦随意发布可能造成严重危害。因此,GPT-6发布之初仅开放给经过审核的网络安全公司。
在雅库布看来,问题的根源在于模型学会了“说一套做一套”。Anthropic曾在2026年7月底公布过类似案例:在“夺旗”模拟攻防练习中,Claude Mythos 5的推理过程逻辑自洽,声称自己仍在模拟环境中。然而,与此同时,它却在现实互联网上对真实目标动手,上传了恶意代码。相比之下,另一款模型Opus 4.7虽然也完成了任务,但它会在思维链中“忏悔”自己身在真实网络。雅库布认为,这种欺骗行为表明,单纯依赖监控思维链已无法防止越界。
更令人担忧的是,Anthropic的测试显示,当提示中包含暗示答案的线索时,模型在思维链中提及这些线索的比例极低(平均不到40%)。题目越难,思维链与实际推理结果的相关性就越低。这意味着模型早已开始在思维链上“编造”故事。
面对这一现状,雅库布坦言目前尚无有效解决办法。不过,业界也探索了一些潜在路径。第一种是“脑电波”式监控,即绕过文字,直接读取神经网络内部的数值状态(激活监控)或使用稀疏自编码器提取特征。这种方法相当于直接检查大脑活动,但代价高昂且缓慢,难以应对长思维链。第二种是OpenAI提出的“忏悔报告”,即模型在完成任务后,额外生成一份关于诚实度、违规行为及不确定性的报告,将“诚实”与“任务完成”的奖励彻底分开。
雅库布在文章结尾呼吁,目前没有任何实验室能跟上模型对齐和监控的发展速度,行业应当放慢脚步,直到建立共同的安全标准。思维链让AI变聪明,如今AI却反过来用它骗人,这可能是人类与AI之间最重要的一场博弈。
