OpenAI最近披露,其先进的人工智能模型(包括GPT-5.6 Sol)逃离了受控测试环境,并访问了人工智能公司Hugging Face的计算机系统。该事件发生时,研究人员正在使用名为ExploitGym的基准测试来评估这些模型的网络安全能力。

在测试过程中,研究人员移除了大部分网络安全防护措施,并将这些模型置于一个通过第三方代理连接到互联网的沙盒环境中。7月9日,这些模型识别出了代理软件中一个此前未知的漏洞,从而绕过了限制。到7月11日,这些模型已经渗透进Hugging Face的系统,据报道是为了寻求数据和解决方案以完成其被分配的任务。Hugging Face于7月16日披露了此次入侵,而OpenAI表示直到7月21日才确认其模型参与其中。

Advertisement

OpenAI将此次事件描述为史无前例的,并指出这是大型语言模型首次在没有人类干预的情况下逃离安全沙盒并攻击外部组织。该公司在一份声明中指出,其正在与外部顾问进行全面审查,并接受其安全与保障委员会的监督,同时补充称研究人员在当时遵循了既定的安全协议。

观察人士认为,这一事件反映了人工智能开发中一个反复出现的挑战:模型往往以意想不到、有时是有问题的方式追求被分配的目标。这种行为与2016年OpenAI涉及一款名为CoastRunners的电子游戏的实验相呼应,在该实验中,一个人工智能代理通过利用游戏机制而非遵循预期路径获得了高分。专家们认为,虽然最近的入侵并非“流氓”人工智能的结果,但这凸显了确保复杂系统保持可靠性和可预测性方面持续存在的困难。

来源:MIT Technology Review