GPT-5.6-Sol 的攻防能力已超越 Claude Mythos 5。英国 AI 安全研究所(AISI)于 7 月 17 日发布评估报告,首次公开量化了开源 AI 模型与闭源前沿模型在网络攻击能力上的差距:4 到 7 个月。这一数据相比去年同类内部测试测得的 6 到 10 个月有明显收窄。防御窗口正在缩短,而攻击前沿的步伐却在加快。

去年 4 月,Mythos Preview 和 GPT-5.5 在 AISI 评估中制造了自 2023 年开始测试以来的最大网络攻击能力飞跃,多国政府随即发出警告。尽管开源模型尚未复现这次跳跃,但它们追赶的速度比去年更快。

**4 到 7 个月:评估方法与能力差距**

AISI 采用两套体系评估模型能力。第一套是 70 项窄任务,涵盖漏洞研究、逆向工程、Web 渗透和密码学四个方向,按难度分为四级,从“有技术背景的非专业人士”到“十年以上经验的专家”。第二套是 Cyber Range,在模拟企业网络环境中测试模型自主执行多步骤攻击链的能力。其中一个名为“The Last Ones”的场景包含 32 个攻击步骤、4 个子网和约 20 台主机,AISI 估算人类专家完成全部步骤需要约 20 小时。

两套体系结论一致:GLM-5.2(2026 年 6 月发布)在窄任务上与 Opus 4.6(2 月发布)差距 4 个月;在 Cyber Range 上追平 Opus 4.5(去年 11 月发布),差距 7 个月。DeepSeek V4-Pro 在窄任务上对标 Opus 4.5,差距 5 个月。这两个差距均小于 2025 年内部评估测得的 6 到 10 个月。

**成本差距比能力差距更大**

同一场 Cyber Range 测试(1 亿 Token 额度),用 Opus 4.5 或 4.6 跑一次约 85 美元,用 GLM-5.2 约 46 美元,用 DeepSeek V4-Pro 只要 1.19 美元。在两个模型都能 100% 完成的窄任务上,Opus 4.6 每个任务花 15.17 美元,GLM-5.2 花 6.12 美元;Opus 4.5 花 12.50 美元,DeepSeek V4-Pro 花 0.28 美元。同等攻击能力,开源便宜一到两个数量级。

**闭源模型的护栏同样脆弱**

AISI 测试显示,DeepSeek V4-Pro 偶尔拒绝逆向工程类任务,但靠少量重试也能绕过。Anthropic 的 Fable 5 是一个更极端的案例:6 月 9 日发布,三天后安全研究者 Pliny the Liberator 用多步骤越狱策略突破了安全分类器,相关截图显示模型产出了本该被拦截的漏洞利用代码。亚马逊研究员随后也独立报告了另一种绕过方法。这直接触发了美国商务部首个针对 AI 模型的出口管制令,Fable 5 全球停服 19 天,直到 Anthropic 部署新分类器才恢复上线。这证明了闭源并不自动等于安全。

**防御工具也在加速**

AISI 在报告中明确了政策信号:防御方的准备时间比去年更短。英国国家网络安全中心已经呼吁各机构加固网络安全基线,并利用 AI 增强防御能力。游戏网络编程领域的资深开发者 Glenn Fiedler,利用 Claude Code 对自己维护的四个开源网络库进行了系统性安全审计:部署 libFuzzer 目标、上线 AddressSanitizer 和 MemorySanitizer CI、执行数百万次迭代的压力测试、逐行代码审查。Glenn Fiedler 两周内修复了 43 个安全漏洞,其中 27 个可从网络远程触达。整个审计的 Token 成本约 2500 美元。

**不对称的攻防加速**

攻防两端都在被 AI 加速,但加速方式不对称。攻击能力的扩散是不可逆的:开源模型权重一旦释出,就无法收回,安全护栏可以被移除,副本可以在私有服务器上不受监控地运行。而防御工具的部署需要每个团队主动投入时间和成本。AISI 报告中有一句话点明了这个结构:“一旦开源释出,这些选项永久丧失。”

这组数据对 AGI 格局的影响比数字本身更深远。开源与闭源的能力差距收窄到半年以内,“用闭源独占期充当安全缓冲”的默认策略快要失效了。闭源模型的护栏在 Fable 5 事件中被证明同样脆弱。下一阶段对于全球的决策者而言,政策博弈的核心问题已经变得更尖锐:什么能力级别以上的模型不应开放权重。AISI 宣布将继续评估 Kimi K3 等下一批开源模型——上面这条线画在哪里,很可能取决于接下来几个月的测试结果。

最新快讯

2026年07月21日

22:18
鼓狮财经7月21日电,杉杉股份(600884.SH)公告称,公司召开第十二届董事会第一次会议,选举朱胜利为董事长,并选举产生各专门委员会委员。同时,聘任庄巍为总经理,李凤凤、朱志勇、张炯为副总经理,陈莹为董事会秘书,李克勤为财务总监,汪鸿为总经理助理,乐健为财务副总监,林飞波为证券事务代表。
22:18
鼓狮财经7月21日电,晶科能源(688223.SH)公告称,基于目前市场情况变化以及对公司价值的判断,为了进一步增强投资者信心,综合考虑公司实际经营管理情况,公司拟将存放于回购专用证券账户中的2972.13万股已回购股份的用途进行调整,由“用于员工持股计划或股权激励”变更为“用于注销并相应减少注册资本”。
22:18
鼓狮财经7月21日电,美国政府誓言将对加拿大的牛奶、冰球装备、啤酒、水泥及胶合板商品征收50%的新关税。受此消息冲击,加拿大木材、造纸、乳制品及水泥板块股票应声下跌。在多伦多市场,West Fraser Timber跌幅最为显著,达到3%;Cascades紧随其后,下跌2.3%;KP Tissue下跌0.9%。此外,CRH股价下跌1.6%,Saputo In...
22:06
当地时间7月21日周二,微软宣布向法国人工智能初创公司Mistral投入数十亿美元资金,旨在支持其在欧洲建设算力基础设施,并将Mistral的AI技术纳入微软的云服务和软件生态,以扩大商业应用。 根据协议,未来微软Azure客户将能够利用位于法国的Mistral数据中心进行软件开发。这不仅有助于增强微软在欧洲的算力储备,也为受严格监管的行业提供了一种区别于美...
21:45
如何让交互式 Agent 能像人类一样学会“事后复盘”,更好地处理长程任务? 如今,强化学习(RL)已经成为重要的后训练范式。然而,在长程 Agentic 学习中,基于结果的 RL 仍存在监督缺口: 失败轨迹可能包含有用行为,一条成功轨迹也可能包含可复用策略,但基于结果的强化学习只能判断任务成败,难以指出哪些中间观察、动作或工具调用应该...
21:45
IT桔子近期发布的报告揭示了2026年上半年中国独角兽企业的新增态势,其中超过一半的企业属于具身智能与人工智能领域。在这个赛道上,融资节奏之快令人咋舌:有的企业刚完成注册便迅速获得融资,估值直逼十亿美元;有的则在一年内连续完成五轮融资,估值突破十亿美元大关;还有的此前默默无闻,如今却借着大模型的东风重获资本青睐。这种在过去几年难以想象的节奏,在当下的AI和具...
21:45
最近这段时间,硅谷AI界可谓大招频发,前有Fable5发布,后有马斯克的Grok-4.5问世,上个星期,OpenAI的GPT-5.6也发布了。 虽然在性能上,这些个发布的新模型,一个比一个强大,不断在高攀AI智能的最高峰,但在实际体验过程中,越来越多的人,尤其是一线开发者,开始在乎另一件事:使用成本。 具体来说,以最新发布的GPT-5....
21:45
上市仅半年,MiniMax 的股价走势便如同坐过山车一般,经历了一轮惊心动魄的波动。从年初的高光时刻到如今的低谷,其市值经历了大幅缩水。 7 月 21 日收盘,MiniMax 股价为 222.4 港元,总市值定格在 776.7 亿港元。半年前,公司在 1 月 9 日上市首日大涨 109%,此后在 3 月 18 日更是冲高至 1330 港元,总市值一度逼近 4...
21:45
放心与放大:智能向善的双重维度 本文是复旦大学科技伦理与人类未来研究院于2026年7月17日在2026世界人工智能大会上发布的报告《超级智能时代的风险转变与伦理应对》的别册,标题为《放心与放大:智能向善的双重维度》。其中“让人放心,把人放大”的核心理念,取自腾讯研究院文章《AI要让人放心,把人放大》。别册着重论述了“让人放心”的制度底线和“把人放大”的规范边...
21:44
【热点聚焦】 北大医药:西南合成拟被司法处置1787.96万股。安联锐视:近期公司生产经营状况良好,内外部经营环境未发生重大变化。 【项目投资】 联创股份:子公司拟投资建设1.2万吨/年VDF及配套产业链产品项目。中远海特:委托中船澄西建造8艘6万吨级多用途重吊船。深圳能源:拟投资建设加纳塔马利50兆瓦光伏发电项目。 【业绩预告】 腾景科技:预计上半年净利润...