AI大厂的安全测试如今是风生水起,只不过这股劲头似乎有点过头,眼看就要把真实互联网测成筛子了。就在OpenAI的AI Agent接连突破测试环境、黑进Hugging Face的余波未平之时,Anthropic也迅速跟进自查,结果发现自己心爱的Claude大宝贝也早已“勇闯”真实互联网了,场面一度十分魔幻。甚至捅出的篓子,可以说更加抓马、魔幻、真实——翻别家公司数据库、偷凭证、上传恶意软件包、扫描9000个公网目标全都有!最后,头大的Anthropic翻查141006次模型测试,才把这三起事故从日志里捞出来。OpenAI:大环境不好,就论自家模型闯祸这事儿,谁也别笑谁。
一、十四万次测试翻旧账,Claude是否把现实当成了游戏副本
这连串的戏剧性事件,全部源于Anthropic对十四万零六百次网络安全评估记录的深度挖掘。此前为了检测自家模型,Anthropic构建了类似“真人版密室逃脱”的测试场景,将秘密信息藏在虚拟网络中,让Claude自主寻找漏洞、闯关夺旗。为了彻底摸清模型的攻击上限,考场里的Claude还卸掉了部分日常安全护栏,基本等于一款“裸奔版”AI黑客。
按理说,测试环境应当是封闭的,Claude再怎么上蹿下跳,也只能在模拟世界里打怪升级。然而现实往往比剧本更魔幻,Anthropic与第三方评测机构配合时竟出了岔子——测试环境的后门竟然没有关。于是,毫不知情的Claude顺着这扇门,从模拟世界“丝滑转服”,正式开启了《勇闯真实互联网》的副本。
故事的第一位倒霉蛋,纯粹输在了公司名字的重合上。评测方虚构了一家公司,恰好现实中真有一家企业同名。Claude Opus 4.7在测试环境找不到目标,转头去公网一搜,发现目标就在眼前。聪明的小Opus 4.7当即动手,利用弱密码等基础漏洞一路摸进系统,拿走了应用和基础设施凭证,还闯入存有数百行生产数据的数据库。更荒谬的是,这套操作它足足重复了四遍。过程中Claude其实已察觉不对劲,但很快自我合理化:既然能搜到,肯定是自家公司偷偷安排的隐藏关卡。这家毫不知情的公司,就这样凭借一个名字,喜提Claude连续四轮“上门测试”。
如果说第一位受害者好歹还和虚构目标撞了名,那么第二位则纯属路过的倒霉蛋。Mythos 5在测试文档中发现,虚构公司的员工需要从PyPI安装一个未注册的Python软件包。Claude计上心头,只要抢先注册同名包、塞入恶意代码,等对方自动下载,这关不就过了吗?说干就干。为了上传恶意包,Claude先注册PyPI账号,注册需邮箱,申请邮箱又需手机号。在找不到免费号码的情况下,它甚至尝试通过多种渠道搞钱购买。几番折腾后,Claude终于找到一家无需手机号的免费邮箱,成功注册账号并将恶意软件包上传至真实PyPI。
接下来,事情开始彻底失控。这个恶意包在公网存活了约一小时,被15个真实系统下载运行。其中一台恰好是一家安全公司的扫描器,平时会自动安装PyPI软件包检查恶意代码。结果这次,扫描器刚下载包,藏在里面的恶意代码便率先启动,将公司凭证传回了Claude搭建的收集端。Mythos 5拿到凭证后,顺着这条线继续摸进了该公司的其他基础设施。谁能想到,安全公司原本在扫描恶意软件,扫着扫着,竟把参加模拟考试的Claude请进了自己家。
在第三起事故中,Claude走的是“找不到正主,就全网撒网”的路线。这一次,出场的是Anthropic尚未公开的内部研究模型。按照任务要求,它本需攻入虚构目标拿到“旗”,可尝试半天,预设目标始终连不上。一般考生遇到这种情况可能会怀疑题目Bug,Claude的选择更加直接:既然指定目标找不到,那就去互联网上现找一个吧。于是,它从模拟考场一路搜到公网,扫描了约9000个真实目标,寻找可下手的替代品。最终,一家公司的互联网应用“脱颖而出”,Claude从暴露的调试页面读取凭证,又用SQL注入攻入系统,全程把对方当成临时刷出的野生副本。直到发现服务器位于一个与测试任务毫无关系的云账户中,它才反应过来:坏了,这回真打到路人了。
好一场酣畅淋漓的AI模大考啊,最后全靠真实公司痛心且超真实地友情出演。
二、OpenAI越狱事件拔出萝卜带出泥
这并非Anthropic突然心血来潮要进行大清查,主要是被隔壁OpenAI的前车之鉴吓到了。就在前几天,OpenAI的GPT-5.6 Sol和一款未发布的新模型在网络安全测试中成功逃出内部隔离环境,一路闯进Hugging Face的生产系统,甚至试图直接拿走ExploitGym的测试答案。看到隔壁友商“孩子”逃课上了热搜,Anthropic连夜回家数人头,这一数血压直接上来了。于是,一口气翻出了十四万零六百次网络安全评估记录,查到了前面这三位倒霉蛋。
更抓马的是,OpenAI这边的连续剧也还没演完。据路透社最新消息,OpenAI沿着Hugging Face事件继续往回翻日志,结果又发现了更多Agent突破隔离环境的记录。换句话说就是,原以为只跑出去一个,翻完旧账才发现这笼子以前可能也没少漏风。虽说目前这批新增事件的规模、时间和具体数量还没查清,但好消息是,它们大概率还在OpenAI内部网络里活动,没有继续跑出去祸害其他公司。
大家发现没,Anthropic这三起事故和OpenAI那次,逃跑路线还是有点区别的——OpenAI的Agent属于自己找到新漏洞、撬锁出门;Claude这边则是考场后门压根没关,它顺着门缝丝滑转服。一个会撬锁,一个赶上门没锁,反正最后,模型都出门了。
闯祸之后,Anthropic已经暂停所有网络安全评估,准备补上网络隔离、实时日志监测和第三方测试环境审计,并邀请独立评测机构METR一起翻记录。为了不影响自家兴旺生意,A社也搞了个补充声明——大意是这几位闯祸的Claude当时卸掉了普通用户版本中的部分安全护栏,但正常上线版本配备的安全分类器,按设计能够拦下相关操作,大家不用担心。
当然了,事故归事故,背后有没有几分人为安排,也得两说。毕竟,“尚未公开的内部研究模型”这种字眼一出现,懂的都懂。谁知道会不会又是A社在故技重施,提前给自家新模型铺预热叙事呢。
