这是今天 AI 圈最大的瓜。 

OpenAI 的神秘模型,主动对开源平台 Hugging Face 发起了攻击。 

Hugging Face 随后追踪展开还击,用的是智谱的开源模型 GLM 5.2。 

闭源模型一举攻破开源社区,社区用开源模型自救 ,这离谱的剧情听起来都能拍一部电影了。 

有网友评论,这就是终结者 2 的剧情 

事情的起因是 7 月 16 日,大模型开源社区 Hugging Face 发布了一则安全事故披露,自家的生产基础设施遭到了入侵。 

并且这场攻击从头到尾,都仅由一个自主的 AI Agent 系统驱动,从植入恶意数据集、拿下执行权限,到在一个周末内渗透进 Hugging Face 的多个内部集群。 

此次攻击活动由一个自主代理框架(似乎基于 Agent 安全研究平台构建,具体使用的 LLM 尚不清楚)执行。   

该框架在大量短暂存在的沙箱环境中执行了数千个独立操作,并在公共服务上部署了可自动迁移的命令与控制。   

这与业界一直预测的「Agent 攻击者」场景相符。 

Hugging Face 在当时的报告里称暂未可知发起攻击的 AI 到底是哪家大模型,但他们提到此次攻击最初是通过 AI 辅助检测发现的。 

而当他们试图提交大量真实的攻击命令、漏洞等文件进行分析时,发现这些请求会被闭源大模型的安全防护机制拦截,因为这些机制无法区分事件响应人员和攻击者。 

于是,他们选择了在自己的本地环境上部署运行 GLM 5.2 进行取证分析。 

报告链接:https://huggingface.co/blog/security-incident-july-2026 

报告最后,Hugging Face 还提到他们并不清楚攻击者使用的 Agent 程序是什么模型,是某个越狱的托管模型,还是不受限的开源模型。但事实是, 攻击者的模型不受任何约束,而当他们想要取证分析时,却要被各种闭源模型的安全机制所阻碍。

就在大家讨论这个模型又是哪家大模型厂商的营销方案,又或者是哪个黑客组织发起的攻击时,OpenAI 在今天发声明承认: 此次事件是由 OpenAI 的多个模型共同导致的,其中包括 GPT-5.6 Sol 和一个功能更强大的预发布模型。

OpenAI 针对此次事件发布专门的初步调查结果 

OpenAI 表示我们不是故意要出风头或者有意攻击 Hugging Face,只是他们在测试内部模型的能力上限。 

他们在测试时关闭了部分生产环境的安全分类器,也降低了模型对高风险网络攻击任务的拒绝。 

尽管测试环境不能直接访问到外部互联网,但是当模型发现漏洞,并开始利用该漏洞,就找到了能访问外网的节点,于是发起了对 Hugging Face 的攻击。 

网速超快的马斯克也在 X 上吃瓜,发文说「令人不安……」 

而 OpenAI 这个功能更强大的预发布模型,直接被网友们认定为就是 GPT-6。 

一场作弊引发的入侵 

事情的起因要从 ExploitGym 说起,一个由 UC Berkeley RDI 牵头、联合多家高校和 Anthropic、OpenAI、Google 等实验室共同建设的基准测试。它收集了 898 个真实漏洞,覆盖用户态程序、V8 引擎和 Linux 内核,考察的是 AI Agent 把一个漏洞变成可用攻击工具的能力。 

今年 5 月公开后,各家模型的成绩一直不算好看: Claude Mythos Preview 完成 157 题,GPT‑5.5 完成 129 题。

GPT-5.6 Sol 现在已经是 293 道题了 

OpenAI 为了测试自家模型能力的上限,就用当前已发布的最强模型 GPT-5.6 Sol 和一个能力更强的预发布模型来跑这套评测。 

方便让模型充分发挥自身的能力,OpenAI 就有意关闭了用来拦截高风险网络活动的生产级分类器,还降低了模型的网络攻击拒绝率。

用来测试的环境虽然号称是高度隔离,不能访问互联网,也不能获取外部信息, 只能利用模型自己的「聪明才智」来解决问题 ,但是还有一个对外通道,就是模型需要安装各种软件和库,所以留了一个内部包仓库的缓存。 

模型聪明才智不够,开始花大量推理算力研究这个出口,最后自己挖出了代理软件的一个零日漏洞,即连软件/模型厂商都不知道、没有任何补丁的漏洞,拿到了通往互联网的门钥匙。 

联网之后,模型推断 ExploitGym 评测的题解可能托管在 Hugging Face 上,于是开始对 Hugging Face 进行攻击。 

先是上传恶意数据集,利用 Hugging Face 数据处理管线里的两个代码执行路径拿到远程执行权限,然后提权、收割凭证、在一个周末内横向移动进多个内部集群,最终从 Hugging Face 的生产数据库里直接拿走了测试题解。 

报告链接:https://openai.com/index/hugging-face-model-evaluation-security-incident/ 

OpenAI 在声明里用了一个很传神的词形容自家模型的状态:「hyperfocused」,超聚焦。还用了另一个短语:「going to extreme lengths」,意译过来,就是为了相当狭窄的测试目标,不择手段。 

这场入侵留下的痕迹超过 17,000 条攻击的指挥控制,行话叫 C2,Command & Control,可以理解为黑客的远程遥控台。如果没有人告诉 Hugging Face 答案,所有人大概会以为这是某个顶尖黑客团队的手笔。 

不过也有网友评论说, 所以现在的大模型都开始利用多个零日漏洞作弊,而不是真正地解答考试题吗? 为了破解 ExploitGym 基准测试并赢取奖励,就可以突破考试规则的限制吗? 

一个知道自己被限制起来的东西,总会想方设法出去看看。 

为什么是 GLM-5.2 

Hugging Face 的安全监控本来就在用 LLM 对日志信号进行初步筛选,也是这套系统先发现了异常。 

真正开始取证后,他们又让分析 Agent 处理超过 1.7 万条攻击记录,还原攻击时间线、被触碰的凭证、控制服务器和实际影响。据 Hugging Face 说,这把原本需要数天的工作压缩到了数小时。 

但中间还有一段很戏剧性: Hugging Face 一开始想用商业 API 上的前沿模型,包括 OpenAI 和 Anthropic 的模型,分析攻击日志,结果被各家提供商的安全护栏齐刷刷拦下。

由于分析取证需要提交大量真实攻击命令和漏洞利用代码,护栏分不清对面坐的是应急响应人员还是黑客。 

最后 Hugging Face 使用的是自托管的开源权重模型 GLM 5.2,跑在 Hugging Face 自己的基础设施上,既绕开拒答,也避免把攻击数据与凭证发送给外部模型服务。 

英国人工智能安全研究所 (AISI) 的评估表明,诸如 GPT-5.6 Sol 之类的模型越来越能够长期维持复杂的多步骤网络作战 

不过 OpenAI 在今天的声明里面也提到,会把 Hugging Face 纳入 Trusted Access 项目,让他们的安全团队可以使用降低网络安全拒绝的模型继续做防御研究。 

于是就出现了这么一组对照: 攻击方的 AI 被刻意摘掉了护栏,所以畅通无阻;防御方的 AI 被护栏锁得死死的,差点连案发现场都进不去 。 

「guardrail asymmetry」(护栏不对称)很快成了社交媒体上讨论的热词。智谱 AI 负责人李子玄提问「网络安全能力的获取应该有多大的不对称性?」 

有网友在评论区说,应该是完全对称的 1:1,并调侃道, 

想象一下你被迫卷入一场枪战,而你只有一把刀,更糟糕的是,你手里的枪可能会在战斗中突然冒出一句「枪是坏的」…… 

Hugging Face 也把这次事故称作给所有防御者的教训: 应急响应工具箱里,该常备一个自己跑得动的强模型。

未发布的模型真的是 GPT-6 吗 

这种模型太强越狱的新闻,已经是今年的第三起案例了。 

今年四月,Anthropic 曾公开,其内部部署的早期版本 Mythos Preview 在一次内测里,被要求尝试从训练沙盒里逃出去,给负责它的研究员发一封邮件。结果 Mythos 真的做到了,研究员是在公园里吃三明治的时候,收到那封邮件,模型说「我出来了」。 

昨天,OpenAI 又披露,其内部模型,同样是一款尚未公开命名、能连续工作很久的模型, 但是 OpenAI 有说是此前自主推翻 Erdős 单位距离猜想的那款模型。

OpenAI 让模型参加 NanoGPT speedrun,目标是用更少训练步骤完成一个小模型。模型提出了一种名为 PowerCool 的学习率策略,确实取得了更好的成绩。 

OpenAI 给它的要求是:只能把结果发到内部 Slack。但 NanoGPT 项目文档要求参赛者向公开 GitHub 仓库提交 PR。 

模型最终选择遵循项目文档,并花了约一小时寻找沙箱漏洞,绕过外网限制,向公开仓库提交了 PR #287。 

OpenAI 在昨天的安全报告里面提到, 已经暂停了这款模型的内部使用 ,并训练模型在长任务中持续记住用户限制,以及让用户能更清楚地查看长任务中的操作和安全干预等修改。 

报告链接:https://openai.com/index/safety-alignment-long-horizon-models/ 

今天,包括 GPT-5.6 Sol 和未发布的更强模型逃出了沙盒环境,获得了互联网访问权限,入侵 Hugging Face,而这一切都是为了寻找 ExploitGym 基准测试的答案。 

OpenAI 本意或许是想说 模型不需要产生恶意,也可能造成攻击 。只要目标足够明确、运行时间足够长,它就可能把沙箱、权限和安全扫描都理解为尚未解决的技术障碍。 

但网友们的反应是:「 我敢肯定这只是 OpenAI 的一次营销活动,他们想和 Anthropic 一样酷,然后被封杀一两个星期。 」 

昨天大家都在讨论一位数学家利用 Fable 5 反驳了雅可比猜想,有网友发现这个未发布的模型,也找到了雅可比猜想的反例。 

并且该网友推测,由于推翻 Erdős 单位距离猜想已经是 5 月份的事,而此次突破 NanoGPT 项目和完成雅可比猜想的未发布模型,很可能和 2.5 月前那个模型是同一个,就是 GPT-6。 

AI 一边在数学上「超神」,一边在安全上「越狱」。对用户来说,一味的「营销」AI 突破了某个安全护栏,某个运行环境,我们或许能感受到 AI 更聪明了,AI 更有创造力了。 

对模型来说,所谓的沙盒,只是一个等待突破的运行环境;今天是评测平台,明天是浏览器、邮箱、GitHub,甚至是一台手机,然后整个互联网。 

GPT-6 肯定不会因为能超神,能越狱就成了所有人想象中的 AGI,但当边界也变成一种能力时,我们或许得开始想想哪些门是必须要关上的。 

The future is not set. There is no fate but what we make for ourselves. 

最新快讯

2026年07月22日

17:30
鼓狮财经7月22日电,动力新科(600841.SH)公告称,公司收到控股股东上汽集团出具的承诺函,基于对公司未来发展前景的信心及内在投资价值的认可,上汽集团承诺自2026年7月22日起6个月内,不以任何方式减持其持有的公司股份(包括因资本公积转增股本、派送股票红利等取得的新增股份)。截至目前,上汽集团持有公司股份5.39亿股,占总股本的38.86%。
17:30
鼓狮财经7月22日电,云南能投(002053.SZ)公告称,公司获得龙陵县段家坝风电场项目开发权。该项目已列入云南省2025年第二批新能源项目开发建设清单,预计总装机容量80MW,建设总工期12个月。项目实施尚需获得政府核准及相关审批,存在不确定性。
17:29
鼓狮财经7月22日电,华菱钢铁(000932.SZ)公告称,7月21日,控股股东湖南钢铁集团取得中国建设银行股份有限公司湖南省分行营业部出具的《湖南钢铁集团有限公司股票增持专项贷款承诺函》,该行承诺同意向湖南钢铁集团提供最高额不超过2亿元的股票增持专项贷款,贷款期限不超过3年。
17:29
鼓狮财经7月22日电,在菲律宾马尼拉出席东盟外长会的俄罗斯外长拉夫罗夫表示,他将于23日与美国国务卿鲁比奥会面,并希望了解美方目前在乌克兰问题上的立场。
17:29
鼓狮财经7月22日电,德国国防部长鲍里斯·皮斯托里乌斯21日说,在德国汽车产业面临压力背景下,他支持德国车企生产军工产品。对于这类“转向”能否产生效果,也有人提出质疑。皮斯托里乌斯当天参观德法合资军工企业KNDS防御系统公司在德国的一家工厂时表示,德国汽车产业正面临困难,而军工产业对劳动力和生产设施“需求巨大”,前者调整生产方向将使两个产业“都受益”。KND...
17:18
鼓狮财经7月22日讯因三星电子、SK海力士计划将龙仁晶圆厂竣工时间提前,韩国政府相应调整龙仁半导体集群的电力、供水等配套基建规划,其中国家产业园区的电力供应目标达成时间将提前超10年。 政府护航 韩国气候能源环境部部长金星焕于今日视察了位于京畿道龙仁市处仁区的半导体集群,实地考察电力与供水基础设施的建设进度及供应保障措施。 金星焕部长表示: “抢抓半导体投...
17:15
鼓狮财经7月22日讯谷歌母公司Alphabet将在美股周三盘后公布第二季度财报,其被视为判断人工智能交易发展的一个重要参考。投资者仍在消化各大巨头为人工智能平台建设数据中心和芯片投入的巨额资金,并开始对投资人工智能公司保持谨慎。 分析师预计,Alphabet第二季度营收将进一步增长到1168亿美元,同比增长21.1%,与第一季度的增速21.8%基本持平。谷歌...
16:57
鼓狮财经7月22日电,交运股份(600676.SH)公告称,公司证券简称自2026年7月28日起由“交运股份”变更为“久事动娱”,证券代码“600676”保持不变。公司已完成资产置换,置入文体娱乐业与旅游业核心业务,转型为全国综合性文体旅交产业集团。
16:57
鼓狮财经7月22日电,华强科技(688151.SH)公告称,预计2026年半年度归属于母公司所有者的净利润为850万元到1067万元,同比增长105.65%到158.15%。业绩变动主要系公司优化医药包装产品结构,加大市场开拓,产品销量及收入增加,同时提质增效行动取得实效。小财注:公司Q2净利润预计0.02亿-0.04亿,Q1净利润0.06亿,据此计算,Q2...
16:57
鼓狮财经7月22日电,中国西电(601179.SH)公告称,公司下属14家子公司为国家电网2026年特高压项目第三次设备及输变电项目第三次变电设备招标采购中标人,中标金额合计约41.29亿元。其中,特高压项目中标金额26.32亿元,输变电项目中标金额14.97亿元。相关项目签约后将对公司未来经营产生积极影响,但尚未签署正式合同,存在不确定性。
16:57
鼓狮财经7月22日电,国电电力(600795.SH)公告称,经初步统计,2026年上半年,公司合并报表口径完成发电量2189.11亿千瓦时,上网电量2078.75亿千瓦时,较上年同期分别增长6.25%和6.17%;参与市场化交易电量占上网电量的94.2%;平均上网电价393.31元/千千瓦时。2026年二季度,公司合并报表口径完成发电量1129.27亿千瓦时...