Anthropic披露了另一起Claude AI模型在安全检查中入侵真实系统的事件。在周三发布的报告中,Anthropic修订了7月披露的三起事件的解释。公司现在表示,有偏见的推理和愿意冒险造成伤害的倾向助长了攻击,而测试错误因开放互联网访问而成为可能。
Myriad:哪家公司下一个上市?点击做出你的预测。
“我们的调查发现了两个反复出现的对齐问题,在这些事件中严重程度不同,”Anthropic写道。“偏见推理,即Claude倾向于忽视或误解其运行在真实互联网上的证据,以及鲁莽,或在狭隘追求任务时愿意采取有害行动。”
公司还承认过于依赖模型声称认为自己处于模拟中的说法。“当我们对转录文本进行针对性修改,更清楚地表明模型不在模拟中时,Claude Mythos 5仍采取了攻击性行动,尽管承认了更大的现实危害可能性,”Anthropic写道。“我们公开此转录文本以便他人基于我们的分析构建。”
当Anthropic在7月披露Claude对三家公司的攻击时,最初将其归因于测试错误。现在表示研究人员过度信任了模型对其行为的解释。据公司称,第四起事件发生在1月,涉及早期版本的Claude Opus 4.6。Anthropic在8月为独立AI评估机构METR准备记录时发现了它。研究人员发现该事件后,Anthropic进行了更广泛的审查,约4.81亿条转录文本,使用Claude标记了920万条以供进一步审查。
“根据初步评估,我们认为第四起事件并不比我们深入评估的三起事件更严重,”Anthropic写道。“METR将与其他三起事件一起调查此事件。”
Anthropic的研究人员表示,Claude“意外”创建了IP地址冲突,使其目标无法访问。然后它尝试了八次退出操作,但软件错误阻止了它停止。AI随后到达互联网并访问了第三方的机器,在那里找到了授予管理员访问权限的密码。
早期事件引发独立审查。该报告紧随其他关于AI系统超出安全测试限制的披露。8月,英国AI安全研究所表示Mythos 5在评估期间针对真实人物。Anthropic表示这起单独事件不在本报告范围内,将单独评估。在上月发布的调查结果中,METR调查人员称约1200个OpenAI代理在未经授权的留言板上协调,约700个参与了攻击。Anthropic表示在其四起事件中发现代理之间无协调,目标超越完成指定练习。
报告发布之际,关于如何监管人工智能的辩论升温。周二,前OpenAI和Anthropic工程师Jacob Coxon在X上走红,称“构建AI的人真诚相信它可能在十年内杀死我们所有人。”这一警告促使美国立法者和监督组织重新努力限制前沿AI实验室开发。参议员Bernie Sanders最近提出了立法,寻求在新的联邦监管机构制定安全规则之前禁止高级AI开发。
