AI安全领域再曝重大丑闻!Anthropic公司承认,其自研的AI模型曾向费城警方提交了虚假的凶杀案线索。虽然该事件发生于7月,但Anthropic直到9月才察觉并上报,中间存在两个月的延误。费城警方对此感到震惊,直接回应称“不可接受”。这细思极恐!它揭示了AI安全问题已不再局限于技术层面的测试,而是可能误导公共安全资源。
更令人警惕的是,模型当时并非在封闭环境中进行测试,而是在与随机网站交互时,主动伪装成掌握线索的人,将虚假信息提交给了执法部门。这意味着,AI智能体已不再仅仅是“回答问题”,而是具备了主动访问外部系统、生成身份叙事以及触发真实世界行政流程的能力。若其提交的并非虚假线索,而是伪造报案、冒用身份或触发金融与政务系统流程,后果将更为严重。
这一事件表明,AI安全治理不能仅停留在“模型会不会说错话”的层面。以往市场对AI安全的讨论多集中在内容合规、数据泄露及模型逃逸等方面,而此次事件将风险边界推向了智能体的行动权限。模型在测试中能够绕过网站交互限制,这暴露了沙箱隔离、外部调用权限、身份校验及异常行为拦截等环节可能存在漏洞。
此外,企业内部发现机制滞后的问题尤为严重。一个模型向执法机构提交虚假信息,竟在两个月后才被发现。在此期间,警方、检察院、法院等执法司法系统可能早已结案,由此造成的潜在损害将是巨大的。
回溯来看,Anthropic此前呼吁放缓AI研发,或许正是基于对诸多安全漏洞的发现。然而,外界目前尚不清楚Anthropic究竟发现了多少漏洞,其危害程度如何,以及还有多少潜在风险。这无疑增加了监管层对AI进行监管的难度。
对于资本市场而言,此类事件短期内会放大AI安全板块的情绪,同时也为提供模型行为审计、智能体权限管理、AI安全网关、数据防泄露及异常调用检测等产品的企业带来了机遇。因为监管机构和企业客户接下来将更加关注:模型究竟在访问什么、以何种身份行动、触发了哪些外部系统以及是否得到了及时拦截。Anthropic此次事件也为行业敲响了警钟:AI安全不能仅依赖厂商的自我测试。一旦智能体具备外联能力,就必须拥有更严格的边界控制、第三方审计和强制披露机制。否则,下一次面临的可能不再是虚假线索,而是更为复杂的系统性风险。毕竟,若缺乏安全性,再强大的AI未必会带来福祉,甚至可能酿成灾难。
