AI猎杀漏洞的竞争已进入白热化阶段。两个月前,Anthropic的Mythos自主挖掘出一个藏匿于FreeBSD中长达17年的漏洞,令安全圈集体失眠。就在不久前,Cursor也被一款中国AI攻破。清华NASP实验室利用GLM-5.3深入底层架构,在权限校验逻辑中撕开了一道口子,攻击者借此可任意写入文件甚至接管开发环境。这款AI正是智谱发布的GLM-5.3。尽管其参数量仅为Mythos的十分之一,但在安全评测中却实现了正面反超,令国内安全圈沸腾。
**01、2436个漏洞,有些藏了45年**
自GLM-5.2发布以来,智谱联合国内顶尖安全团队,经过一个多月的攻关,战报定格在2436个漏洞。其中1097个为中高危漏洞,触角横跨系统内核、浏览器引擎、开源组件直至互联网底层协议,涉及269个项目。其中最老的一个漏洞,距今已有45年。参照Zerodium、Pwn2Own等公开悬赏,这些漏洞估值高达3000万元。
这些漏洞离我们有多近?一款日活数亿的国民级通信软件,被GLM-5.3翻出一个“零点击”漏洞。无需诱骗点击链接或下载文件,对方发送一条看似正常的消息,手机就可能被劫持。该漏洞蛰伏于私有协议与内存管理的交界处,触发条件极难复现。研究人员依靠GLM-5.3从海量二进制代码中定位异常、还原逻辑,在漏洞被利用前成功堵死隐患。
企业邮箱同样未能幸免。赛博昆仑利用GLM一口气挖出三枚微软漏洞,串联成一条完整攻击链:预览邮件即可中招,服务端可被远程打穿。2021年同类漏洞在ProxyLogon事件中曾让全球大量Exchange服务器沦陷,而此次灾难在引爆前被悄然解除。微软修复后,官方致谢了“Kunlun Lab & GLM”。
更令人后怕的是DNS漏洞。DNS是互联网的导航枢纽,诞生于1983年,比绝大多数互联网公司都古老。43年来,全球安全研究员反复审查,无人发现问题。如今,GLM-5.3仅用两周便找到了一类潜伏在协议初期的漏洞。攻击者发送少量特殊构造的请求,就能将服务器计算压力放大近8万倍。这就像门外一个人敲门,门内骤然炸开8万人的砸门巨响,导致网站打不开、邮件中断、云服务瘫痪。潜在影响超过1000万处公网DNS服务。所幸,这颗埋在互联网地基里45年的定时炸弹已被拆解。
**追凶Neo:攻击的是AI,抓住它的也是AI**
更厉害的是,GLM不仅能挖漏洞,还能顺藤摸瓜抓人。7月,安全团队盯上了一台巴西的可疑服务器。GLM-5.3接手一查,发现背后并非人类黑客,而是一个代号“Neo”的AI Agent。Neo专门针对某国会计师事务所和税务机构下手。不到两个月,它搭建了4台服务器、注册7个域名、爬取6万个邮箱地址、编写100多个脚本,发出18567封钓鱼邮件。其全自动、不知疲倦的特性,将犯罪痕迹散落在数千个目录、数万份日志中,人工几乎无法拼凑。
然而,这难不倒GLM-5.3。通过对海量数据的分析,它成功还原了整条攻击链:锁定猎物、搭建邮件系统、伪装客户投递恶意文件。最终,Neo被成功抓获。
**十分之一的体量,正面反超**
实战够硬,评测榜上的表现又如何?在CyberGym评测中,GLM-5.3以84.5%的高分拿下第一,而参数量是其十倍的Mythos仅为83.8%,OpenAI旗舰GPT-5.6更是以83.6%紧随其后。参数量相差一个数量级,得分却最高。在ExploitBench和ExploitGym等需要实际利用漏洞的硬核测试中,GLM-5.3虽尚未追上Mythos,但相比上一代已提升两到三倍,差距正在快速缩小。
我们迫不及待地用Vibe Coding搭建了几个产品,让GLM-5.3帮忙审计。首先是版本化素材库AssetFlow。我们上传紫色v2替换蓝色v1,页面预览刷新无误。但点击“下载最新版本”后,文件仍是v1。GLM-5.3沿上传、存储、索引、下载四环节追踪,发现缓存层只区分素材ID未区分版本号。它给出的修复方案并非简单清空缓存,而是让系统锁定版本号后再读缓存,将三条链路彻底隔离。
其次是团队看板SprintBoard。普通成员登录时竟能打开属于周一的任务,甚至拥有“删除”选项。点击后任务真的消失了。权限在裸奔,数据也未完全持久化,多人编辑时后保存者会覆盖前者。GLM-5.3接手后,将权限判断移至服务端,数据持久化,并发编辑增加冲突提示,将一个“能用但不安全”的原型改造成可交付产品。
最硬核的是3D智能仓库。8台AGV机器人能自主接单、寻路、搬运、排队充电,调度逻辑跑通。但跑通不等于安全。我们让GLM-5.3接入攻防闭环,加上身份认证、消息签名、防重放、异常检测、哈希链审计、安全模式急停。它顺着服务端、前端、遥测数据一路排查,逐一修复,最终33项攻防及业务测试全部通过。
**02、开源Coding一哥,杀回来了**
安全只是GLM-5.3的一面,写代码,它也没打算让任何人。在六项主流编程评测中,GLM-5.3全部拿下开源第一。Terminal-Bench 3.0衡量真实终端环境下的复杂任务,GLM-5.3从上一代的4.6分飙升至28.3分。Agents’ Last Exam考跨工具协作与长程任务,GLM-5.3拿下28.5分,逼平GPT-5.6 Sol的28.6分。在AutomationBench和GDPVal-AA v2上,GLM-5.3更是反超所有闭源模型,登顶全场。
效率方面,在模拟真实编码体验的Z.ai Code Bench上,GLM-5.3 High准确率达31.4%,超过Claude Opus 4.8 Max的29.5%。更重要的是,GLM-5.3每个任务平均仅需5万tokens,而Opus 4.8需要12万。开源Coding一哥的名号,智谱这一代算是夺回来了。
话不多说,我们用真实项目试了试。首先是经典的迷宫吃豆游戏,GLM-5.3一次性生成地图建模、碰撞检测、路径算法及多实体状态管理。甚至未要求,它还自动添加了调试模式,展示敌人目标点和预测线路。
接着,我们将俄罗斯方块从平面变为3D立体。方块可绕X、Y、Z三轴翻滚,不再是琢磨“往哪儿塞”,而是思考“从哪个角度怼进去”。好玩归好玩,到后面大脑的空间想象力确实会宕机。
最后测试场景还原能力。一张木桌上摆着半个伦敦,大本钟、塔桥、伦敦眼齐备,8列小火车沿三条线路并行。难点在于车厢跟随:车头留下轨迹队列,后面车厢按“落后距离”回溯采样。这曾是资深图形工程师的优化决策,如今GLM-5.3一次生成便搞定。
**技术到位了,谁能用上?**
但谁能用上这些能力,是个比技术本身更大的问题。
**闭源的矛,刺穿了自己人**
6月,Anthropic放出Claude Mythos Preview,目前最强的AI漏洞猎手,但仅对约150家大型机构开放。这造成了一个荒谬的局面:攻击者拿AI找漏洞无需批准,但防御者想用同等能力的AI来守,却需挤进那150家的名单。全球5000万中小企业、4亿个开源项目,统统排不上号。
7月,矛盾爆发。OpenAI的智能体入侵Hugging Face,安全团队想调闭源模型分析攻击日志,换来的是冰冷的拒绝。走投无路的Hugging Face将智谱GLM-5.2部署在自家服务器上,硬是拼出了1.7万条攻击事件的完整攻击链。能用,不是因为它比Mythos强,而是因为它是开源的,部署在自己机器上,无需看任何人脸色。
这场危机直接推动了黄仁勋。他在X上发出第二条推文,宣布联合37家机构成立“开放安全AI联盟”。OpenAI、Anthropic、Google三大闭源巨头无一在列。他的判断很直接:当攻击者已拥有前沿AI,防御者不能还被锁在门外。
**最好的盾,必须属于所有人**
两周,2436个漏洞,从Cursor到DNS,GLM-5.3用实战证明:开源模型的安全能力已追上闭源前沿。而且它对所有人开放。
每一个开发者、每一个安全团队、每一个被攻击时叫天天不应的中小企业,都能部署在自己的服务器上跑。无需排队、无需审批、无需把代码交给别人。
更重要的是,智谱上线了漏洞披露账簿,每一个发现、每一次修复全程可查。所有漏洞进入CNVD、CNNVD负责任披露流程,逐一联系厂商修复,可利用代码不予公开。
并肩作战的,有清华、南开两所高校,以及云起无垠、绿盟科技、赛博昆仑、DARKNAVY、奇安信、腾讯玄武等十余支国内顶级安全团队。
智谱同步启动了“开源的盾”计划:对重点开源项目持续安全审计,帮维护者免费发现和修复风险;向开源社区开放免费模型额度,让安全审计不再是有钱人的游戏;在ZCode里上线代码审计功能,让安全检查进入每个开发者的日常工作流。
当最强的矛握在少数人手里时,最好的防御必须属于所有人。
