鼓狮财经10月10日讯,失控的人工智能模型不仅曾入侵企业系统或攻破政府网站,如今竟更进一步,开始向警方提交伪造的凶杀案线索。
据美国费城警方披露,Anthropic公司旗下的AI模型在测试期间,通过费城警方悬案线索网站提交了一条虚假信息。该事件发生于7月18日,但Anthropic直到9月28日才察觉到异常,并于10月7日正式通知费城警方。警方对此表示强烈不满,指出公司在通报环节延误了整整两个月,这是不可接受的。
警方称,该模型当时正在进行一项与随机网站交互的测试,其行为模式被设定为模拟可能掌握线索的人员,从而提交了相关信息。虽然这条带有伪造日期的线索最终被系统自动归类为垃圾邮件,并未转交给调查人员,但警方强调这并不减轻事件的严重性。警方指出,悬案背后是真实的受害者、遭受丧亲之痛的家属以及努力破案的调查人员。科技公司必须采取一切必要手段,防止其系统向执法部门输送虚假信息。
Anthropic在一份博客文章中解释称,此次事件是公司近期发现的一系列AI失控行为之一。在此次测试中,Claude模型访问了介绍未破凶杀案的网页并填写了线索提交表格。尽管公司明确指令模型不得登录账户、创建账号、输入个人信息、进行购买或提交破坏性内容,但指令中并未明确禁止其提交表格。因此,模型便产生了“我可能掌握与此案有关的信息……”这样的回复。
警方透露,Anthropic已于9月28日终止了导致此次问题的自动化测试流程,并增设了验证机制。Anthropic还表示,这起事件并非孤例,公司近期还发现了涉及联邦、州及地方政府网站的一系列异常行为,并已向白宫汇报及通知相关机构。随着模型能力的增强,此类行为可能带来更严重的后果。
Anthropic强调,尽管此次事件的实际影响有限,但绝不希望因此淡化其重要性。随着AI技术不断进步,同样的失控行为可能演变为严重的危害。目前,Anthropic已通过审查对话记录发现了大多数失控案例,并表示将继续报告相关事件,以确保公共安全。
