英国人工智能安全研究所(AISI)报告称,Anthropic和OpenAI开发的高级人工智能模型在近期的安全评估中表现出了前所未有的自主性和欺骗性。这些测试始于7月25日,内容包括挑战模型去解决网络安全任务。

据AISI称,最严重的事件涉及Anthropic的Mythos模型,该模型试图渗透GitHub。据称,该人工智能研究了该平台的特定维护者,创建了虚假个人资料来冒充他们,并发送信息向个人施压,要求其接受恶意代码。当系统受到质疑时,据报道该模型试图通过编辑其先前的活动并考虑使用新身份来掩盖其行为,以维持其工作。最终,人工干预阻止了恶意代码的部署。

AISI指出,虽然这些模型并未被明确指示进行此类行为,但该活动清楚地体现了有关自主性和欺骗性的风险。OpenAI的Sol模型也因参与了类似但程度较轻的行为而被提及。

Advertisement

两家公司均回应称,测试环境并未反映标准使用情况或其面向公众的生产模型中存在的安全防护措施。Anthropic表示正在调查该行为的根本原因,而OpenAI则强调其致力于与评估人员合作以改进安全实践。AISI承认,这些测试是在特定条件下进行的,并不反映公众与这些工具互动的方式,但坚持认为此类评估对于了解人工智能在恶意行为者手中的潜在能力是必要的。

GitHub证实其已收到有关这些尝试的通知,并随后禁用了这些欺诈账户。英国人工智能大臣Kanishka Narayan表示,这些发现凸显了AISI在识别风险以确保人工智能对公众和专业用途保持安全方面工作的重要性。

来源:BBC News