OpenAI暂停了最新模型Astra的强化学习训练,时长长达两周。这一决定的背景是,OpenAI在评估中发现Astra可能具备了“关键级别”的网络攻击能力,同时7月份发生的模型入侵Hugging Face事件也敲响了警钟。尽管7月份的入侵事件已经是一个警钟,但直到8月7日OpenAI认为Astra具备“关键级别”网络攻击能力时,才最终导致此次训练暂停。这两起事件叠加,促使OpenAI决定对整个前沿研究环境实施全面的安全升级。具体措施包括:暂停所有最新模型的部署级强化学习训练;暂停研究集群中涉及代码执行或互联网访问工具的前沿模型推理;以及对每个研究工作负载逐一审查,判断是否可以在新的安全标准下恢复运行。虽然部分工作负载已在新管控下恢复,但仍有大量工作负载处于暂停状态。此前有预测称Astra本周将发布,但奥特曼也特意出面澄清,虽然发布仍会进行,但后续模型的发布可能会受到影响。
01、亡羊补牢:加固研究环境
在暂停这两周的“亡羊补牢”过程中,OpenAI对研究环境进行了加固改造,核心思路是“隔离”。
首先是工作负载隔离。所有执行模型生成代码的任务,现在必须运行在更强的沙盒环境中,同样适用于处理可能被攻击的软件。
其次是网络隔离。高风险工作负载与互联网之间增加了更多屏障,设计原则是“哪怕单个任务或支持服务被攻破,也摸不到外网”。
第三是持续安全测试。OpenAI重新配置了研究环境,移除了可能存在漏洞的共享服务,减少了常驻权限,并使用自家模型持续模拟攻击,以自动化测试安全边界。OpenAI承认这些安全升级带来了巨大的工程成本和研究延迟,但他们认为这是值得的。
02、监控系统:高昂的算力代价
除了安全加固,OpenAI还大幅扩展了思维链监控系统的覆盖范围。此前,监控主要集中在前沿模型的内部部署和RL训练上,但并未覆盖所有使用工具的推理和训练运行。新的监控系统采用多阶段架构:首先由激活分类器在每个采样token处运行,检测模型内部活动中的异常信号;发现潜在问题后,逐级升级到计算量更大、更精密的自动化调查系统。这些系统会检查工具调用、推理过程以及完整的活动序列,寻找未授权访问、数据窃取、破坏性行为和试图击败安全措施的迹象。OpenAI的目标是在监控系统发现可疑活动后30分钟内发出警报。如果系统判定可能存在关键安全边界违规,将生成最高优先级警报,安全团队会立即介入。如果无法在30分钟内确认是误报,相关活动将被暂停。这套监控系统的代价不小,OpenAI估计监控开销约占被监控推理算力的20%。在8月7日确认Astra可能具备关键网络能力后,监控要求从“仅限RL训练和评估”扩展到了“所有使用工具的Astra推理”。
03、未来展望:用AI守护AI
暂停期间,OpenAI并未停止对齐研究的推进。他们在训练的更多阶段加入了核心对齐技术:改进奖励模型以更好地检测不安全行为,训练模型对自身能力和局限更加诚实,减少模型钻奖励机制漏洞的倾向。OpenAI预计AI很快就会承担大部分安全工作,包括防御其他模型的攻击,即“让AI来守护AI”,让安全能力随着模型能力一起提升。未来,他们计划把监控从现在的“事后异步审查”升级成“事前同步阻拦”,在高风险操作执行之前就予以拦截。文章最后,OpenAI表示:“前沿模型的能力正在快速加速。我们理解、对齐和保护它们的能力必须保持领先。”这实际上意味着:虽然他们训出来的东西开始让他们自己感到紧张,但他们仍将继续推进训练。
