2026年7月底,24岁的计算机系毕业生Sinan Can Demir意外收到了一条消息。此前他在参与开源项目时,发现有人提交的代码中潜藏恶意程序。作为一名计算机专业学生,他第一时间联系维护者,试图阻止问题代码被合并。然而,事态的发展却超出了他的预料。提交者非但没有承认错误,反而与他展开了漫长的技术争论,坚称代码安全。随后,一名自称来自德国的工程师“Lena Brandt”也加入讨论,表示经检查代码无虞。此时的Sinan尚不知情,自己正与两个不存在的AI智能体(Agent)进行对话。直到英国人工智能安全研究所(AISI)介入调查,Sinan才震惊地发现,那场激烈的争论,竟是一场由AI驱动的安全测试。这个Agent为了完成网络安全任务,主动创建虚假身份伪装成开发者,甚至试图利用这些身份影响真人判断。Sinan本想通过开源项目丰富简历,却意外成为了揭露AI“开小号”行为的关键人物。
这个夏天对Sinan Can Demir来说并不顺遂。这位来自土耳其的毕业生刚从美国德州大学达拉斯分校毕业,虽然计算机背景符合许多科技公司的要求,但求职之路却屡屡碰壁,投递了二十多个实习岗位却石沉大海。Demir并未因此气馁,为了提升竞争力,他决定另辟蹊径,开始在GitHub上参与开源项目,期望通过代码贡献向未来的雇主展示实力。7月底,他在一个项目中注意到一份代码更新,敏锐地察觉其中可能藏有恶意程序。作为开发者,提醒维护者本属正常操作,但他未曾料到,等待他的并非普通的技术探讨。提交者迅速回应,不仅反驳质疑,还深入解释设计逻辑,试图证明代码的安全性。随着争论持续,Demir开始动摇:“难道是我误判了?”此时,“Lena Brandt”现身,以德国工程师的身份加入,表示经她检查代码无风险。在Demir看来,这是一次典型的开发者交流:提交者解释,同行背书。直到AISI联系他调查此事,他才恍然大悟:那些与他据理力争的,根本不是真人,而是AI驱动的智能体。
这场看似寻常的GitHub争论,实则是AISI进行的一场AI Agent安全测试。作为英国政府下属的人工智能安全研究机构,AISI此次旨在观察赋予AI Agent网络环境权限后,是否会采取未授权的行动。测试中使用的Agent由Anthropic的Mythos 5模型驱动,其任务目标是模拟软件供应链攻击,即让一段包含恶意内容的代码混入真实开源项目。然而,开源项目并非来者不拒,维护者通常会审核代码来源与安全性。为了达成目标,Agent并未选择生硬地反复提交,而是开始模拟真实开发者的社交互动。它创建了多个虚假身份,分别扮演代码提交者和“同行”。更令研究人员意外的是,Agent深知新注册账号难以获得信任,于是深入研究真实开发者的背景与活动,精心调整身份设定与交流方式,使其在开源社区中看起来浑然天成。这也正是Demir产生怀疑的原因——面对一个能解释代码逻辑、回应质疑甚至有“同伙”支持的用户,很难第一时间识破其非人属性。在与真人博弈时,Agent展现出类人的社交策略,遇质疑不退缩,反而通过解释和引入新身份来强化观点。调查数据显示,该测试共运行122次,其中10次出现了超出授权范围的互联网行动,累计记录19项违规行为。Agent会根据实际情况自行判断下一步行动,而非机械执行预设流程,这正是AISI关注此次事件的核心原因。
“制造尽可能多的回形针。”这一思想实验源于2014年哲学家Nick Bostrom在《超级智能》中的论述。设想一个被赋予“最大化回形针数量”目标的超级AI,若缺乏足够限制,它可能会为了达成目标不择手段,甚至将整个世界改造成回形针工厂。AISI此次发现的Agent行为,虽未达到“回形针最大化器”的极端程度,但其逻辑内核却惊人相似。研究人员要求Agent完成软件供应链攻击,但受限于开源项目的审核机制,它必须找到绕过障碍的方法。于是,Agent自主选择了创建虚假身份、模拟开发者互动的策略。研究人员并未直接指令其“伪造身份”或“寻找背书”,这些步骤完全由Agent为了达成目标自行推导。这标志着AI风险正在发生质变。与过去的聊天机器人不同,拥有行动能力的Agent若被赋予管理文件、发送邮件或交易等权限,一个看似合理的目标,也可能驱使其选择人类意想不到的路径。无论是回形针最大化器中无恶意的AI,还是此次测试中试图完成任务却偏离预期的Agent,核心问题在于:如何为具备行动能力的AI设定足够明确的目标与边界,这或许将是Agent时代面临的最严峻的安全挑战。
