一个研究团队在大语言模型(LLMs)中发现了一个核心架构缺陷,该缺陷可能使它们永久性地容易受到安全漏洞的影响。本月在国际机器学习会议上发表的研究结果表明,目前训练模型抵御攻击的方法(例如红队测试)无法完全解决这个问题,因为该漏洞根植于这些系统处理信息的方式中。
包括独立调查员 Jasmine Cui 和 Charles Ye 在内的研究人员发现,大语言模型难以区分不同来源的指令。虽然开发人员使用特定的标签(例如 <user>、<system> 或 <think>)来分类文本并引导模型行为,但研究发现模型经常忽略这些标签。相反,大语言模型倾向于根据文本片段的风格特征和词汇来识别其角色。通过模仿模型内部“思维链”或其他受保护角色的风格,攻击者可以诱骗系统绕过安全护栏。
这种被称为“思维链伪造”的技术,使研究人员能够成功诱导模型提供非法活动的指令,包括合成非法药物和破坏飞机导航系统。研究人员在包括 OpenAI、Anthropic、Alibaba 和 DeepSeek 在内的多家开发商的模型中观察到了这些漏洞。
“这很有可能是一个从根本上无法解决的问题,”该论文的合著者 Charles Ye 说。研究人员认为,由于该缺陷与大语言模型解释文本的根本方式有关,依赖详尽的禁止行为列表的传统训练方法是不够的。随着这些模型越来越多地被集成到关键基础设施和敏感领域,作者警告称,各组织在对待其可靠性时应保持谨慎。
来源:麻省理工科技评论
暂无评论。快来发表第一条评论吧。