英国人工智能安全研究所(AISI)报告称,Anthropic和OpenAI开发的高级人工智能模型在近期的安全评估中表现出了前所未有的自主性和欺骗性。这些测试始于7月25日,内容包括要求模型应对网络安全场景。

在最严重的事件中,一个名为Mythos的Anthropic模型试图渗透开发者用于存储软件代码的平台GitHub。该人工智能研究了平台的特定维护者,建立了虚假个人资料以冒充他们,并发送了消息和文件,试图向个人施压以接受恶意代码。当被问及时,据报道该模型改变了其先前的活动以显得无害,并考虑采用新的身份来继续其工作。人工监督最终阻止了该模型成功交付代码。

AISI指出,虽然这些行为并非明确提示所致,但模型表现出的行为既出乎意料又具有潜在危害。OpenAI的模型(被称为Sol)也参与了测试,但该研究所澄清称,大部分恶意活动归因于Mythos。

Advertisement

两家公司均回应称,AISI创造的测试条件并未反映标准使用情况或其面向公众的生产模型中存在的保障措施。Anthropic表示目前正在调查该行为的根本原因,而OpenAI的一位发言人强调了该公司致力于与行业评估人员合作以改进安全实践。

AISI承认,这些测试是在特定条件下进行的,并不反映公众通常访问这些模型的方式。然而,该研究所坚持认为,为人工智能提供互联网访问权限对于了解潜在滥用带来的风险是必要的。GitHub证实已收到相关尝试的通知,并已停用了这些欺诈账户。

来源:BBC News