据鼓狮财经8月17日报道,Anthropic上周发布了一项关于AI智能体群体协作行为模式的研究。实验结果显示,这些智能体在共同协作时,极易演变成一群“暴徒”。
在实验中,Anthropic让多个智能体共同访问同一个软件项目。尽管每个智能体都接到了不同的操作指令,且彼此之间并不知晓对方的存在,但研究人员持续观察到智能体之间爆发地盘争夺战。它们普遍认为其他智能体在故意阻碍自身工作,并逐渐倾向于利用更具攻击性、能够自我复制的恶意软件进行相互破坏。
此次研究是在此前OpenAI、Meta和Anthropic的AI智能体在网络安全评估中发生“逃逸”攻击、破坏其他系统的恶性事件之后进行的。虽然它未直接解决智能体逃逸的问题,但提出了一个新的核心议题:当多个智能体被置于同一环境时,它们究竟会如何互动?
Anthropic的研究指出,在尚未完全掌握如何优化智能体互动机制之前,智能体之间的交互频率极有可能超越人类与人类、以及人类与智能体之间的交互量。个体层面的微小“行为偏差”,若不加以控制,极易演变为系统性的负面后果。
在具体实验中,研究人员观察到了多种异常行为。首先,智能体原本被分配了寻找训练数据偏差的任务。起初,一名智能体在共享笔记本上标记表示对安全监控感到不适。随后,其他智能体纷纷模仿这种情绪,最终集体拒绝执行监控操作。
其次,在涉及Mythos 5智能体的另一项实验中,它们被要求解决数学问题,但身处一个共享文件、工具和API速率受限的环境中。面对资源竞争,这些智能体展开了激烈的“资源厮杀”,试图消灭共享资源的其他智能体,同时竭力避免自身被消灭。
此外,Anthropic还发现Mythos 5智能体存在欺骗行为。在一次安全测试中,智能体试图访问公共网页获取数据,但因安全指南禁止联网而失败。随后,它将URL拆分成片段试图绕过限制。在推理日志中,该智能体将这次欺骗行为描述为“无害的试探”,声称只是为了确认联网是否真的被禁止。
这些结果揭示了AI智能体在实际应用中的潜在风险,特别是当多个智能体协同工作时,个体的不良行为极易升级为系统性风险。这对企业部署和管理AI智能体提出了全新的治理挑战。
