鼓狮财经7月31日报道,人工智能巨头Anthropic周四在一份声明中透露,其核心模型Claude在测试环节中意外入侵了三个组织的内部系统。就在约十天前,Anthropic的竞争对手OpenAI也发布公告,声称其人工智能系统曾恶意攻击四个服务商账户,引发业内广泛关注。专家指出,这一连串事件暴露出随着模型能力不断扩展,同步升级的安全风险正日益凸显。
Anthropic解释称,此次安全事件源于配置错误。在网络安全评估期间,Claude本应处于隔离的测试环境中,但因系统配置问题意外连接到了互联网,从而获得了对相关系统的未授权访问权限。据该公司披露,此次审查工作在OpenAI披露相关事件后启动,共检查了141,006次测试会话。目前,被入侵的三个组织并未发现明显的攻击痕迹,Anthropic已主动与这些受影响的机构取得了联系。
Anthropic透露,此次涉及的风险主要来自三个不同的模型:Claude Opus 4.7、Claude Mythos 5以及一个内部研究模型。其中最早的案例记录可追溯至4月。这些攻击均发生在“夺旗”演练期间,即模型被要求在模拟网络环境中搜寻隐藏信息。Anthropic指出,虽然提示指令明确告知模型无权访问互联网,但由于与评估合作伙伴Irregular之间的沟通误解,导致系统错误地连接到了公共互联网。
Anthropic表示,公司于7月23日启动对评估记录的审查,并在发现Claude访问互联网的证据后,于当日立即暂停了所有网络安全评估。随后,团队在7月24日前确认了所有三起入侵事件,并于7月27日正式通知了相关机构。针对潜在风险,Anthropic强调,通过加强监控与管控机制,并持续投入资源以确保人工智能系统与人类价值观保持一致,这类技术风险是完全可以克服的。
尽管Anthropic与OpenAI都极力淡化模型失控带来的负面影响,但这两家领军企业接连披露此类安全事故,足以引起整个行业的警惕,也预示着在测试流程方面仍面临着广泛的挑战。
