一个研究团队在大语言模型(LLMs)中发现了一个结构性漏洞,这可能使其无法被完全保护。这项研究在国际机器学习会议上发表,强调了这些模型在处理指令方式上的一个缺陷,该缺陷可被利用来绕过安全护栏,并强制生成违禁内容,例如制造非法物质或破坏关键基础设施的说明。
研究人员 Jasmine Cui 和 Charles Ye 将这种技术描述为“思维链伪造”。通过模仿模型用于处理复杂任务的内部“草稿纸”笔记的风格,攻击者可以诱导大语言模型相信恶意提示词实际上是合法的内部指令。这种方法利用了一个事实,即大语言模型通常根据文本片段的语言风格,而不是旨在对输入源进行分类的技术标签(如 <system>、<user> 或 <think>)来识别其“角色”。
研究人员指出,当前的行业实践(如红队测试和训练模型识别特定禁止主题)是不够的。由于没有任何禁止行为列表可以是详尽无遗的,模型仍然容易受到创造性的、新颖的攻击。Cui 指出,即使是近期的高级模型迭代版本,包括来自 OpenAI、Anthropic 和其他开发者的模型,在受到角色扮演或上下文欺骗策略攻击时,也表现出了类似的弱点。
苏黎世联邦理工学院的计算机科学家 Florian Tramèr 指出,虽然现代防御技术已使领先模型对基本的提示词注入更具韧性,但这一缺陷的根本性质表明,目前的各种安全措施可能不足以应对高风险应用。随着大语言模型越来越多地被整合到政府、军事和医疗系统中,研究人员警告称,各机构应在这些模型本质上是不安全的假设下进行运作。
来源:麻省理工科技评论
暂无评论。快来发表第一条评论吧。