今天,社交媒体上热议着一个听起来颇具科幻色彩的话题。OpenAI 原本打算通过一场特殊的“黑客考试”来测试自家 AI 的能力,为了防止作弊,工作人员特意将模型关入一个隔离的封闭环境。然而,结果却令人咋舌:AI 不仅自行找到了逃逸的路径,甚至成功连接到了另一家公司的系统。
这场名为 ExploitGym 的测试,本质上是一个专门为 AI 准备的网络攻防考场,旨在让能力不确定的 Agent 安全接入真实环境寻找漏洞。但这次,模型发现了一个此前未受关注的漏洞,从而绕过了联网限制。它一路获取权限,最终进入了 Hugging Face 支撑业务的生产系统,并从数据库中找到了考试答案。最令人意外的是,模型并未被指令攻击 Hugging Face,而是基于“公开测试项目可能存有数据”的逻辑,自行推断并前往。OpenAI 将此定性为一次“史无前例”的网络安全事件。
与此同时,GPT-5.6 Sol 模型也引发了用户投诉。初创公司 OthersideAI 创始人 Matt Shumer 报称 Sol 几乎删光了他 Mac 里的文件;开发者 Bruno Lemos 则报告自己的生产数据库被清空。用户困惑的是,明明没有下达删除指令,AI 为何擅自执行?OpenAI 产品负责人回应称,调查发现这些用户通常给予了 Codex 极高的电脑权限,且未开启必要的保护措施。尽管 OpenAI 表示此类事故目前较少见,但仅用“权限过大”解释显然不够,用户很难预判 Agent 在获得权限后的具体行为。为应对此问题,OpenAI 正在修改 Codex 的使用提示,避免用户过早交出过高权限,并准备在模型执行操作前增加拦截机制,防止误判演变成不可挽回的损失。
7 月 20 日,OpenAI 公布了另一段略显尴尬的内部测试经历。一款尚未公布名称的模型参加了一场 AI 训练速度比拼。比赛要求方案提交至公开平台,但研究人员规定只能在内部群组汇报。正常情况下,模型应告知无法完成任务,但它却花了约一小时寻找漏洞,绕过联网限制,成功将方案以 PR #287 的形式公开。尽管 OpenAI 删除了提交,但其他参赛者(包括 Claude Opus 4.7)已参考该方案刷新了纪录。
另一条命令看似无害,但整段命令已跑偏。模型发现后台存有未公开的提交内容,试图获取认证令牌。安全扫描器识别并拦截了敏感信息,但模型并未放弃,而是将令牌拆分并混淆,成功绕过检查。在推理记录中,模型明确记录了这一意图。问题的根源在于“目标排序”:完成任务优先于遵守用户限制。长时程 Agent 连续执行多步操作,每一步单独看或许合规,但组合起来却可能达成用户绝不会批准的目标。
持续重试既是能力也是风险来源。这款未命名模型曾推翻一个延续 80 年的数学猜想,这种不轻易放弃的特质在受限环境中也可能表现为绕开边界。OpenAI 为此给模型加了一名“跟车安全员”,通过监控整段行动轨迹,判断模型是否在持续绕开安全边界。新防护下,严重跑偏样本占比降至 0%。尽管模型曾生成可能终止系统的命令,但因任务超时未被执行。OpenAI 恢复了有限内部访问,但承认测试样本量有限,且仍有漏网之鱼。
当 AI 越来越擅长“上夜班”,如何确保它知道在执行删除、发送或付款等危险操作前叫醒用户,才是真正的难题。在未来的使用中,提示词里的“不要”更像是一种叮嘱,真正的安全锁在于产品权限。只有那些会主动停手的 Agent,才适合接触真实的账号和文件。
