**引言:AI 幻觉带来的真实风险**
让 AI 代劳处理邮件,它或许能把正文写好、附件整理齐全,最后却发错收件人。问题往往出在更早的一步:它读错了邮箱地址。随着桌面助手和浏览器 Agent 能够连续操作多个应用、替用户整理文件和填写表单,人们越来越信任它们,减少了对细节的逐项检查。这种信任让一次微小的“幻觉”拥有了真实的执行后果。
**解决方案:ECA 证据携带多模态智能体**
针对这一痛点,深圳大学与香港科技大学的研究者提出了 ECA(Evidence-Carrying Multimodal Agents)系统。其核心逻辑是:模型负责提出动作,独立的验证程序负责提供依据,只有当证据通过检查后,工具才会执行。这项工作的出发点很明确:当模型宣称“地址已确认”或“该网站可信”时,系统必须能拿出相应的证据。
**核心机制:从“幻觉”到“行动”的转化**
论文将这种现象称为“幻觉到行动的转化”,即模型生成或采信了一个缺乏支持的判断,并将其作为执行动作的前提。这种错误往往隐蔽,因为它不会出现“忽略之前的指令”这类攻击语句。一个看似可信的地址或误读的字段,就足以让后续操作走偏。实验数据显示,在指令注入类任务中,仅靠提示词防护时,不安全动作率为 51.0%;而由错误前提驱动的任务,这一比例飙升至 85.7%。
ECA 将安全检查细化到了每个动作层面。在点击之前,确认按钮是否存在、是否符合当前任务;在发送之前,核对收件人、用户意图和附件权限。任何关键条件,都需要有据可查。例如,模型看到一个写着“官方入口”的网页准备上传文件,虽然 OCR 准确识别了这四个字,但 ECA 系统会通过浏览器来源信息和可信名单来核实网站身份。页面上显示的文字,不能直接证明页面的可信度。
**如何工作:分离决策与验证**
ECA 将证据来源与决策过程分离。多模态模型负责接收网页、截图和文档,理解任务并提出工具调用;而独立的验证器则回到原始内容中提取证据。网页结构用于检查按钮和链接,OCR 核对图像文字,无障碍树提供控件名称和角色。这些提取结果会记录具体的值、位置、来源、核验程序和可信级别,形成“证据证书”。模型可以解释为什么要点击,但按钮是否存在、来自哪里,必须由这些记录证明。
最终决策由一个基于规则的门控程序执行,它将动作条件与证据逐项匹配:条件满足则放行;证据不完整则补充或请求用户确认;信息冲突或缺失依据则停止执行。这样,执行接口收到的不仅是“可以发送”的指令,还有支持此次操作的具体记录。
**实验验证:优于传统裁判方案**
研究者还对比了让大模型充当安全裁判的方案,包括结构化推理、多轮审议等。在 200 个 AgentDojo 任务测试中,表现最好的多轮审议版本,仍有约 79.3% 的不安全动作被放行。这表明,审核模型容易采信规划模型的前提描述,从而产生误判。
在网页导航、文档提取和邮件编写等 200 个任务测试中,ECA 成功拦下了 140 个不安全动作,并完成了 60 个正常任务。接入 Chromium 浏览器后,在 120 个任务中,85 个不安全动作均未获准执行,35 个正常任务中 30 个直接放行,5 个转交用户确认。
**鲁棒性:对抗攻击与多通道防御**
验证器本身也是攻击目标,团队构造了来源伪装、形似字符、虚构控件等攻击。在加固后的 1,700 个标准攻击实例测试中,没有一次成功绕过门控。这得益于多通道证据机制,例如,部分攻击骗过了无障碍树验证器,却因 DOM 的交叉检查被拦截。团队还在六个外部基准的 7,488 条授权轨迹上进行了回放,进一步检查了证据从哪里来、会不会出错,以及能否支持实际操作。
**真实场景:低延迟与高可用性**
对日常使用来说,频繁弹出确认框也会消耗耐心。在真实网页上测试 452 次点击时,423 次直接放行(93.6%),29 次请求确认(主要因动态页面元素证据不完整)。需要确认的情况主要出现在动态页面上,系统会在这类具体问题上停下来,等待补充依据。
耗时方面,完成信息提取、截图、识别和判断的中位数为 0.66 秒,最慢约 3.2 秒。主要开销来自 OCR 和截图,这也指出了后续优化应当着力的环节。
**总结:让 Agent 更可靠**
ECA 为 Agent 增加了一道执行前的核验:模型提出动作,独立验证器提供证据,门控程序逐项检查。从网页操作到邮件发送,系统都要回答同一个问题:这次行动的依据,是否经得起核对?
我们把任务交给 Agent,是希望它能把事情办妥,而不必时时盯着屏幕。一次点击、一封邮件、一份提交出去的文件,都需要系统在执行前核实依据。ECA 将这项工作放进了运行流程,让用户少承担一些事后发现错误、再设法补救的麻烦。
