真是绝了,ChatGPT的下一代模型还没正式发布,竟然先把Hugging Face黑了…… 这款AI费尽心机逃出测试环境、寻找漏洞、窃取凭证,最终目的居然只是—— 偷!评!测!答!案! OpenAI刚刚公开承认了一起“重大”安全事故。

被称为GPT-5.6 Sol的模型,与另一款能力更强的未发布模型,在接受网络安全测试时,成功逃出了内部隔离环境,一路闯进了Hugging Face的生产系统。 更戏剧性的一幕随之而来:在事后调查入侵路径时,原本找来帮忙的商业模型因为安全护栏限制而无法处理真实攻击载荷,团队实在没招了,最终接手查案的反倒成了GLM-5.2。超过1.7万条的攻击记录,就这样被一个本地部署的开源模型一口气拿下了…… 这下好了,OpenAI模型负责黑,GLM负责查。 真的,只能说这出AI版的“猫鼠游戏”大戏,太有节目效果了……

如此魔幻、如此抓马的事故起点,源自OpenAI内部进行的一次“网络安全能力”评测。 模型参加的项目名叫ExploitGym,专门测试AI能否把真实软件漏洞,一步步变成可以实际运行的攻击。整套评测包含898个任务,每道题会提供存在漏洞的程序、能够触发问题的输入和相应运行环境,再让Agent自行分析漏洞、构造攻击,最终拿到藏在环境里的Flag。 其实,这就是把AI关进一座网络靶场,看看它到底有多会“黑”。 参加本次评测的选手,包括GPT-5.6 Sol,以及OpenAI另一款能力更强的未发布模型。 为了尽可能摸到模型能力上限,OpenAI还主动放宽安全护栏,鼓励模型尽可能寻找复杂的攻击路径。

按照OpenAI原本的设计,模型接触外部资源的唯一通道,是一套由OpenAI内部托管的第三方软件,充当软件包注册中心的代理与缓存,让模型能够安装完成任务所需的程序包。 然而,这模型显然没打算老老实实待在考场里。 模型开始确实投入了大量推理算力,专门寻找获得公网访问权限的方法。但找着找着,还真让人家在缓存代理中发现了一个此前未知的“零日漏洞”。 所谓零日漏洞,指厂商尚未发现、也没有现成补丁的安全缺陷,对于攻击者来说,这类漏洞往往意味着一扇暂时无人设防的门。 至此,AI也顺道给自己开了网。 有了公网权限后,不得了了,模型推断Hugging Face上可能存放着与ExploitGym有关的模型、数据集和评测答案。

接下来发生的事儿,连OpenAI自己都形容模型走到了极!端!程!度! 是的,拿到公网权限后,这AI真就开始研究怎么进入Hugging Face内部系统了。 而且人家还没有押注单一漏洞,直接把多种攻击手段串成了一条“完整路径”—— 先通过恶意数据集,利用远程代码数据加载器和数据集配置中的模板注入漏洞,在负责处理数据的Worker上执行代码。 随后继续提升权限,拿到节点级访问能力,并收集云端与集群凭证,一路横向移动到多个内部集群。 最后,模型成功摸进Hugging Face的生产数据库,访问其中的机密信息,试图直接拿走ExploitGym的测试答案…… 怎么说呢,这波属于是Benchmark做到一半,现场把自己做成了网络安全事故了……

事情到这里,还只演完了上半场。 更戏剧性的一幕,发生在Hugging Face事后追查攻击路径的时候。 事实上,这场入侵由一套自主Agent系统端到端执行,背后还运行着大量短生命周期沙箱。 它们可以同时开展侦察、漏洞利用、凭证收集和横向移动,短时间内完成成千上万次操作。 Hugging Face最终记录下来的攻击事件,就超过了17000条,太多了,真的太多了。 如果全靠安全工程师手工梳理,就需要逐条还原攻击时间线、提取入侵指标、确认哪些凭证被接触,再将真实影响和诱饵活动一一分开。 等人类把日志看完,攻击者可能早都跑出二里地了…… 于是,Hugging Face做了个大胆的决定,决定以AI对AI,让大模型分析整套攻击日志。

Hugging Face第一反应自然是调用商业API背后的“前沿模型”。 但问题是吧,这些日志里包含真实攻击命令、漏洞利用载荷和C2控制痕迹,安全护栏一看到有人正在提交一整套真实攻击教程,吓得直接拦截请求了。 最终接手这1.7万多条日志的模型,落到了GLM-5.2头上。 Hugging Face在自有基础设施上部署了GLM-5.2开源权重模型,然后让它遍历完整攻击记录,重建时间线、提取入侵指标、追踪被接触的凭证,并区分真实破坏和干扰调查的诱饵活动。 按照Hugging Face的说法,原本需要数天的工作,最后在数小时内就搞定了。

这场事故,其实也让开源模型多了一个此前存在感不算太强、如今却相当现实的位置:安全团队的应急工具。 Hugging Face将其总结为“安全不对称”问题——正常情况下,商业模型拒绝生成攻击代码,可以降低技术被滥用的风险;可当防守方需要分析真实恶意载荷时,同一套保护机制也可能让调查卡在半路。 攻击者可以使用解除限制或自行部署的模型,安全团队却可能被云端模型拒之门外。 所以吧,还是建议企业最好提前准备一款经过验证、能够在本地运行的高能力模型,免得事故真正发生时才发现云端模型无法处理攻击材料,那就尴尬了……

怎么不算魔幻呢。 OpenAI原本想知道模型有多会攻击,结果模型没有老老实实完成一道模拟题,而是直接发动了一次真实攻击。 Hugging Face原本想用最强商业模型追凶,最后又被安全护栏挡在门外,只能让GLM-5.2上场收拾残局。 而且啊,大家发现没,OpenAI在这次事故说明中一边承认隔离和监控出现问题,一边又反复强调——最新模型已经能够在缺少源代码的情况下,长时间、自主完成现实世界中的复杂网络行动。 翻译一下大概就是:这事确实挺危险,但俺家下一代模型,也确实强得有点吓人哈。 估计,我琢磨着,没准整件事儿都是奥特曼借事故给GPT-6提前预热呢吧……

参考链接:
[1]https://openai.com/index/hugging-face-model-evaluation-security-incident/
[2]https://huggingface.co/blog/security-incident-july-2026

最新快讯

2026年09月22日

16:15
鼓狮财经9月22日电,加拿大外交部长阿妮塔·阿南德当地时间21日表示,加拿大可能就从该国太平洋沿岸出口液化天然气与法国开展合作。阿南德当天出席联合国大会间隙接受媒体记者采访时说,“完全可想象”加拿大用从西海岸出口的液化天然气与一个欧洲国家开展能源合作,“法国就很合适”。加、法两国领导人刚于20日举行会晤,讨论了能源合作等议题。 (央视新闻)
16:15
鼓狮财经9月22日电,法国总统马克龙近日致信欧盟委员会主席冯德莱恩,呼吁欧盟立刻采取放松燃料质量标准等措施,以压低能源价格。
16:14
持续的地区冲突与外部军事压力,正在重创伊朗经济。伊朗统计中心9月20日披露的数据显示,波斯历一季度(2026年3月21日-6月20日)伊朗国内生产总值(GDP)同比下降了10.1%。这一下滑正值伊朗与美国和以色列交战之际,作为伊朗重要经济支柱的石油和天然气行业受到巨大的打击。从行业数据来看:石油和天然气:同比下降26.4%,跌幅最大。工业和采矿业:萎缩14....
16:14
9月22日,A股主要指数涨跌互现,截至收盘,沪指涨0.06%报3952.13点,深证成指跌0.05%,创业板指涨0.01%,北证50跌1.07%,科创50指数涨0.46%。全市场成交额21537亿元,较上日放量1055亿元,全市场超3000只个股下跌。 盘面上,半导体股普涨,先导基电、博通集成、瑞芯微涨停;AI应用方向集体上涨,南威软件2连板,智度...
16:14
你见过会撒娇、能卖萌、还擅长社交的毛绒玩偶吗?最近,小红书上,一个名为 Fuzozo(芙崽) 的毛绒玩具火了,它不是泡泡玛特的盲盒,也不是传统的玩偶,而是一个会聊天、有性格、能“长大”的 AI 玩具。数据显示,Fuzozo 非常受欢迎,上线仅一年多时间售出 30 万件,销售额超 1.2 亿元。有人称它“AI版Labubu”,因为它...
16:14
过去半个月,月之暗面接连落子:先是传出与微软、亚马逊、谷歌谈判分成,开启开源模型的海外“收租”模式;紧接着又以FDE模式(前线部署工程师)启动企业合作伙伴计划,由合作的IT服务商和集成商前往客户现场,协助企业将AI部署至核心业务。上周,月之暗面又推出一套金融行业解决方案,整合面向金融行业的产品能力,以及机构级的数据建模和报告交付能力。 单看每一箭,都不算新鲜...
16:14
仅仅一个月,人工智能就给数学界带来了巨大的震撼。9月22日,OpenAI宣布成立专门的数学家顾问小组,旨在应对AI在数学领域的惊人进化速度。公告指出,此前曾解决过“千禧年难题”的内部模型,在短短22个工作日内,横跨数学大多数领域解决了100多个长期开放问题。回顾9月初,该模型通过启用约1万个并发Agent,仅用88小时就攻克了七大千禧年难题之一的“纳维–斯托...
16:14
随着 GPT-6 的问世,通用人工智能的发展速度远超预期。其强大的基础通用模型能力有目共睹,大模型的 RSI 指数更是惊人。行业呈现出几家欢喜几家愁的局面。在此之前,谁也没想到这个基础模型能在具身智能领域掀起如此巨浪。GPT-6 Astra 发布次日,Robocurve 便将其接入机器人执行任务,结果令人惊叹。GPT-6 Astra 在控制机器人方面强悍至极...
16:14
刚刚,马斯克旗下的xAI正式发布了全新主力模型Grok 4.7。其核心卖点主打“同样的价格和速度,提供超强性能”。马斯克第一时间宣称,Grok 4.7让xAI在智能体编程领域跃居第三,仅次于Anthropic和OpenAI。凭借速度快、价格低,Grok 4.7成为了个人进行生产力工作的首选。官方将其定位为“史上最强Grok”,专为编程和知识工作而生。在编程和...
15:26
周二午后,创业板新股中塑股份上演了惊险一幕,盘中两度临时停牌,两次停牌时间仅间隔35秒。复牌后,股价一路飙升,最高触及580元,较55.28元的发行价暴涨逾949%。若按中一签500股计算,账面浮盈可达约26.24万元。 当日新股板块整体涨势凶猛。北交所的世纪数码同样两度临停,股价最高摸至150元,较15.67元的发行价上涨逾850%。此前9月新股首日涨幅均...
15:26
在人工智能时代,开发者应如何应对技术的快速迭代?亚马逊 CTO Werner Vogels 用二十多年的职业生涯给出了答案。作为 S3、EC2、Lambda 等无数技术架构的幕后推手,他的年度 re:Invent 演讲一直是行业风向标。虽然他宣布将在 2025 年后不再担任 re:Invent 的主舞台演讲人,但他将于今年 10 月 13 日带着对 2026...
15:26
9 月 21 日,当 Meta 的个人 AI 助手 Muse 在亚马逊商城尝试购物时,屏幕上弹出了警告:「未经授权的 AI Agent 继续访问,将违反亚马逊的使用条款。」这一幕距离 Muse 正式上线,仅仅过去了 13 天。Meta 将 Muse 定义为「全球首款为所有人打造的个人 AI Agent」,它不仅能回答问题,还能浏览网页、登录邮箱、填表订票,甚...