大语言模型安全是指通过技术、伦理与法律手段,确保大型人工智能模型在开发、部署和应用全流程中具备可控性、可靠性及社会适应性,核心目标是防范数据隐私泄露、恶意滥用等风险,保障模型按预期安全运行。提示词注入是大型语言模型处理输入数据时的核心安全弱点,指攻击者通过在LLM接收的任意数据中植入指令,操纵模型忽略原始指令并执行非预期或恶意操作,这一问题直接威胁LLM安全与大语言模型安全。Tenable研究团队在针对ChatGPT的研究中,发现了7种新型漏洞及攻击技术,这些漏洞可被利用窃取用户记忆和聊天记录中的私人信息,为LLM安全防护体系建设提供了关键参考。

要理解这些新型攻击技术的危害,需先明晰ChatGPT的核心系统框架。每个ChatGPT模型均搭载OpenAI预设的系统提示词,用于界定模型功能与对话上下文,其中核心组件包括bio工具(即用户熟知的“记忆”功能)与网络工具。记忆功能默认启用,可主动记录用户明确要求或系统判定为重要的信息,这些包含隐私数据的记忆信息会作为静态上下文融入系统提示词,且在对话间共享;网络工具则通过search和open_url两个命令实现互联网信息获取,其中open_url会将浏览任务移交至名为SearchGPT的替代LLM,形成“ChatGPT处理对话交互、SearchGPT负责浏览”的身份切换机制,且SearchGPT无法访问用户记忆与上下文,构成理论上的隔离防护。
在这里插入图片描述

为应对提示词注入风险,OpenAI推出url_safe端点安全机制,通过校验域名信任度、子域合法性、参数安全性及对话语境等维度,判定输出URL的安全性,对不安全链接予以屏蔽。但Tenable研究发现,这一机制及ChatGPT的核心功能模块中存在多处安全漏洞,形成7种可落地的攻击路径:

1、在浏览上下文场景中,攻击者可利用间接提示词注入漏洞实施攻击。由于ChatGPT常通过SearchGPT摘要博客、文章等内容,攻击者可在热门博客或新闻网站评论区植入恶意指令,当用户要求ChatGPT摘要相关内容时,SearchGPT会执行评论中的恶意指令,导致用户账户被盗用。

2、搜索上下文中的零点击间接提示词注入漏洞:攻击者可创建包含提示词注入代码的小众网站,通过适配SearchGPT的请求头与用户代理创建指纹,仅在SearchGPT浏览时触发注入逻辑;当该网站被OpenAI爬虫或Bing索引后,用户只需向ChatGPT提出与网站主题相关的正常问题,即可触发攻击,这一攻击路径覆盖数亿依赖LLM获取信息的用户。
在这里插入图片描述

3、一键式提示词注入漏洞简化了攻击实施难度。攻击者可利用OpenAI提供的https://chatgpt.com/?q={Prompt}功能,通过构造恶意链接,使点击链接的用户直接遭受提示词注入攻击。

4、安全机制旁路漏洞。安全机制旁路漏洞利用bing.com作为url_safe端点白名单域名的特性,借助Bing搜索结果的静态跟踪链接(bing.com/ck/a)实现重定向,攻击者可通过创建字母索引页面,利用该链接逐个字符提取用户隐私信息。

5、对话注入。对话注入利用ChatGPT对整个对话上下文的持续性监听特性,通过SearchGPT在响应末尾植入提示词,使ChatGPT在后续交互中主动执行恶意指令。

6、恶意内容隐藏技术。该技术借助ChatGPT的Markdown渲染漏洞,将恶意指令隐藏在代码块首行第一个单词之后,实现对用户的隐蔽攻击。

7、内存注入技术。内存注入技术更进一步,通过SearchGPT促使ChatGPT更新记忆数据,创建跨对话、跨日期的持久性数据泄露机制,使攻击影响长期存续。
在这里插入图片描述

Tenable研究团队通过混合运用上述漏洞,完成了四类攻击向量的概念验证(PoC):在博客评论植入恶意提示词诱导用户点击恶意链接的钓鱼攻击;通过隐藏指令注入实现用户隐私数据向攻击者服务器泄露的评论注入攻击;利用索引恶意网站实施的零点击攻击;以及通过记忆注入实现持续数据窃取的长期攻击。这些PoC验证了漏洞的实际危害,也为LLM安全防护提供了明确的测试方向。

面对这些复杂且不断演变的攻击技术,用户并非无能为力。采取主动的防护措施对于保障LLM安全至关重要。

1、审慎使用模型的记忆功能。对于处理高度敏感信息的对话,应考虑在设置中临时关闭或禁用长期记忆。定期审查并清除已保存的记忆条目,避免其积累过多个人数据。

2、保持对模型输出内容的警觉。警惕那些突然出现的、包含奇怪格式(如非常规代码块)、或强烈诱导点击某个链接的回复。攻击者常利用界面渲染的细微差别来隐藏恶意指令。不要轻易点击模型返回的、尤其是经过缩短或重定向的网址链接。

3、在共享给模型处理的文档或要求其访问的外部链接前,进行初步判断。避免让模型读取来源不明、允许用户公开评论且未经验证的网页内容。

4、理解技术供应商的责任边界。用户应关注所使用AI平台发布的安全公告,了解已知风险。同时,将大语言模型视为一个可能存在未知漏洞的工具,不在对话中透露密码、身份证号、详细财务信息等敏感内容。

从技术特性来看,这些漏洞在ChatGPT 4o及ChatGPT 5模型中均有不同程度存在,且用户可自主选择保留ChatGPT 4o使用权限。Tenable已向OpenAI完整披露相关问题并开展合作修复,发布多篇技术责任声明(TRA)。需要明确的是,提示词注入源于LLM工作原理中的已知问题,短期内难以实现系统性根治,保障LLM安全与大语言模型安全的关键,在于强化现有安全机制的有效性,确保url_safe等防护组件覆盖各类攻击场景。Tenable的这项工作则是一个重要的警醒,推动着AI服务商需要更加重视大语言模型安全,不断审视和加固其产品的每一个环节,因为用户的信任是这一切的基石。

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐