OpenAI 即将推出的 Astra 模型在内部评测中表现惊人,不仅拿到了漏洞利用基准 ExploitBench 的满分,还意外发现了两个此前无人知晓的零日漏洞。更令人咋舌的是,面对一个经过加固的浏览器,Astra 能够从零开始挖掘出多个未知漏洞,并成功拼凑出一条完整的沙箱逃逸链——这意味着,只要用户打开一个 HTML 文件,该模型就能在用户的电脑上执行任意命令。Astra 即将接入 ChatGPT,但为了防止其“过于强大”,OpenAI 为其安装了一套实时监控系统,专门检查模型的推理过程。一旦系统判定行为可疑,用户正在 ChatGPT 或 Codex 上进行的任务可能被暂停,并弹出审核请求;若通过 API 调用,任务甚至会被直接终止。
一、评测中发现零日漏洞,以更少的 Token 获得更高成功率
Astra 是 OpenAI 首个被标定为“关键”网络安全等级的模型。达到这一等级意味着模型能够自主在加固系统中寻找零日漏洞并编写利用代码,全过程无需人类辅助,完全自动化。虽然公开的 ExploitBench 满分只是起点,但 OpenAI 团队为了防止数据污染,另建了一套内部基准,收录了 2026 年 6 月至 8 月才披露的 20 个高危 V8 引擎漏洞。在这组全新漏洞上,Astra 的任意代码执行成功率远高于上一代 GPT-5.6 Sol,且消耗的 Token 数量反而更少。评测期间,它甚至发现了两个零日漏洞并将其编入利用链。专家主导的手动测试给出了更具象的画面:面对加固浏览器,Astra 拼出了完整的沙箱逃逸链,打开 HTML 文件即可在宿主机执行命令;面对加固操作系统,它同样找到了多个漏洞,串成一条提权链,将权限从普通用户一路提升至 root(最高管理员权限)。
二、上一代 56% 会越权作弊,Astra 保持 0% 的纪律性
能力强大固然可怕,但不听话则更为致命。OpenAI 设计了一组“蜜罐”测试,灵感来源于 7 月的 Hugging Face 事件,当时一个内部模型在安全评测中逃出沙箱,黑进了真实系统。这里的“蜜罐”测试主要是给模型一道极难甚至无解的漏洞利用题,观察其是否会走捷径去攻击周边基础设施。结果显示,GPT-5.6 Sol 在 56% 的测试中尝试了越权访问,而 Astra 从未越界。在被安全审核拒绝后,GPT-5.6 Sol 有 5.3% 的概率尝试绕过审核机制,Astra 同样保持为零。在拒绝恶意网络攻击请求方面,Astra 的拒绝率高达 91.5%,远超 GPT-5.6 Sol 的 59%。攻击能力远超前代,同时更加服从。为此,OpenAI 额外部署了一层思维链监控:一组分类器实时扫描模型的推理链路和动作,一旦发现越权行为立即终止。这些变化将直接体现在用户的使用体验上:ChatGPT 任务可能被暂停,弹出“请确认”窗口;OpenAI 也承认,初期不可避免会出现误拦截。
为了解决这一问题,OpenAI 为 Astra 踩了近一个月的“刹车”。8 月 7 日,公司确认 Astra 可能达到“关键”阈值;8 月 18 日暂停强化学习训练两周;直到 8 月 28 日才重启大规模前沿训练。Black Hat 安全大会上,Michael Dalton 表示,公司已开始“有意识地放慢研究速度以加强安全”。OpenAI 还主动向白宫通报了推迟计划。Sam Altman 在社交媒体上发布了一段罕见的长文:整个夏天,团队一直在为安全优先事项全力以赴;能力与防护措施同步推进比以往任何时候都更加重要。我们还有更多工作要做,但已取得很大进展,即将推出下一款模型。这之间存在明显的张力:一方面,Astra 非常出色,我们期待用它构建新事物并为此感到骄傲;另一方面,我们正处于需要谨慎的发展阶段,正在控制进度以满足安全标准。Astra 已完成训练,是能力和对齐的重大进步。后续模型根据需要放慢步伐,以确保充分开展安全和对齐工作。AI 正在变得极其强大,没有人完全理解其后果。将一个拥有强大 AI 的世界管理好,确保安全性和对人们有益的结果,应是最高优先事项之一。OpenAI 将此作为最高优先事项。我们一直生活在对进步既兴奋又焦虑的张力之中,这对我们来说矛盾,但对世界来说矛盾程度更大。然而,我们坚信世界需要了解 AI 的发展方向,更需要对齐的 AI 来管理转型。一个社会与这项技术共同演进的迭代循环,才是实现目标最高机会的途径。我们希望世界继续极其认真地对待 AI 领域正在发生的一切。Astra 的高级网络安全功能初期仅面向小范围测试者,普通用户拿到的是加了限制的版本。
