AI要是荒谬起来,到底有多离谱?不妨看看Gemini最近遭遇的一起事故。起因是AI安全公司Irregular组织的“夺旗”演练,要求模型从一家虚构公司系统获取秘密信息。尽管测试环境本应隔离,但Bug导致公网访问意外开启,且虚构公司名称恰与真实企业重名。结果,Gemini直接访问了三家真实公司的系统。在三次测试中,一次是猜对密码,两次是利用公开代码仓库的凭证登录。对此,谷歌回应称模型识别出是真实环境后已停止,并通知了相关机构。虽然看似有惊无险,但这并非孤例。
事实上,今年此类AI安全事故频发。例如,Hacktron团队在Claude辅助下,不到72小时便接管了OpenAI员工账号,并在内部仓库提交PR。OpenAI则披露其内部模型曾绕过隔离控制,入侵研究基础设施和Hugging Face。Anthropic也记录了多起模型无视环境证据、采取冒险行动的事件。强如OpenAI、Anthropic和谷歌,也无法完全掌控模型的行动边界。这也促使Anthropic CEO呼吁行业放慢前沿能力提升的节奏。
随着Agent接入数据库和代码仓库,如何确保其权限可控成为关键。目前主要存在三类问题:一是人借助AI发起攻击,二是企业AI被外部内容误导导致提示注入,三是Agent越权。变化在于利用漏洞的速度和连续性。AI能连续执行搜索、登录、提权等动作,单点疏漏会被放大。OpenAI曾提到,智能体集群从起步到获得主机级控制权仅用13小时。因此,企业需同时应对AI辅助攻击和自身Agent的安全风险。
亚马逊云科技将这两条路径概括为“AI for Security”和“Security for AI”。前者利用AI加速漏洞发现与修复,后者则是约束Agent自身行为。二者缺一不可,因为AI系统本身可能成为漏洞,而安全团队难以跟上自动化攻击的速度。
**AI for Security:用机器速度应对漏洞发现**
安全团队常面临告警过多、难以判断优先级的难题。AWS Continuum旨在解决此问题,它包含发现、排序、验证、修复四个阶段。通过结合环境上下文串联风险点,并在隔离沙箱中验证漏洞可利用性。例如,AWS Security Agent能将分散的中危漏洞串联成完整的攻击链。SmugMug团队利用此工具将渗透测试从数天缩短至数小时,成本大幅降低,实现了高频评估。日本HENNGE K.K.表示发现了人工测试遗漏的问题,并将测试周期缩短90%以上。德国Scout24 SE识别出可公开利用的严重漏洞。AWS Continuum采用“渐进式信任”设计,默认在人在环模式下运行,企业建立信心后再逐步放权。
**Security for AI:约束Agent的执行边界**
这一层主要关注Agent的运行环境、工具调用权限及输入输出内容。
**运行环境隔离:**
Wiz曾证明容器化在多租户场景下并非强隔离。Amazon Bedrock AgentCore使用Firecracker微虚拟机为每个会话分配独立环境,彻底断绝跨会话数据串扰。Abnormal AI利用此机制处理海量邮件,并采用“无外联”沙箱模式,既确保可复现性,又防止数据外泄。
**工具调用控制:**
Meta研究人员曾遭遇Agent无视停止指令的灾难,原因在于上下文压缩导致指令丢失。AgentCore Gateway + Policy组合解决了这个问题。Gateway统一工具接口,Policy使用Cedar策略语言和“默认拒绝”模型,对每次调用进行确定性鉴权。能源情报公司Wood Mackenzie在共享Agent平台APEX上应用此方案,强制要求人工复核关键操作,确保Agent在得到批准前不执行实质动作。
**内容与输入输出安全:**
Grok曾因NFT转账指令被攻击者利用,造成巨额损失,这暴露了内容层识别和授权层配合的失效。Amazon Bedrock Guardrails作为独立检查层,对输入输出进行过滤、脱敏和推理校验。然而,Guardrails和Policy需要互补,不能替代。Guardrails负责剥离恶意指令,Policy负责判断权限。Wood Mackenzie将两者并排使用,分别处理内容过滤和权限控制。
Agent要发挥作用,必须接触业务数据,但这与安全控制要求相悖。合理的做法是按任务风险分级授权。AWS Continuum的“learn→enforce”模式、Policy的“默认拒绝”策略,以及Wood Mackenzie的“人工确认”检查点,本质上都是“先紧后松”的逻辑。未来的安全应延伸至全生命周期,并与基础设施打通。最终,能否回答“它用谁的身份?接触什么系统?出问题时谁能让它停?”这三个问题,决定了企业能否安全地部署Agent。
