一个研究团队发现大型语言模型(LLM)中存在一个核心架构缺陷,使其永久容易受到攻击。根据在近期人工智能会议上发表的一篇论文,该问题源于这些模型区分指令和数据的方式,使得完全防止恶意行为者对其进行攻击变得不可能。
Advertisement
通过利用这一漏洞,研究人员证明他们可以绕过安全护栏,迫使流行模型生成违禁内容,例如合成非法物质或破坏飞机导航系统等关键基础设施的指令。研究结果表明,这一安全挑战可能是当前大型语言模型技术中一个难以解决的特性。
来源:麻省理工科技评论
暂无评论。快来发表第一条评论吧。