2025 年 12 月 22 日,OpenAI 发布了一篇关于 ChatGPT Atlas 的安全文章。Atlas 是 OpenAI 推出的内置 AI 智能体的网页浏览器。 OpenAI 在文中写道,提示词注入(prompt injection)“就像网络上的诈骗和社会工程攻击一样”,不太可能被彻底解决。
如果你让 AI 智能体在登录账户的状态下读取你的邮件或浏览网页,这也是你自己的问题。OpenAI 自己列出的成功攻击可能造成的后果(仅为假设情形)包括:转发敏感邮件、转账,以及编辑或删除云端文件。
发出这类警告的并非只有 OpenAI。据 TechCrunch 报道,当月早些时候,英国国家网络安全中心(NCSC)就曾警告说,针对生成式 AI 应用的提示词注入攻击”可能永远无法被完全缓解”。
OpenAI 说了什么
根据 OpenAI 在 2025 年 12 月的描述,ChatGPT Atlas 中的智能体模式可以让浏览器智能体查看网页并执行操作,也就是在你的浏览器里进行点击和键盘输入。 OpenAI 表示,随着智能体能替你完成的事情越来越多,它也成为了”对抗性攻击中价值更高的目标”。
这篇文章宣布了对 Atlas 浏览器智能体的一次安全更新,其中包括一个新的经过对抗训练的模型,以及围绕它加强的防护措施。 OpenAI 称,这次更新的起因是一类新的提示词注入攻击,它们是由 OpenAI 内部的自动化红队测试(即针对自家产品的攻击测试)发现的。
该公司称提示词注入是”一项长期的 AI 安全挑战”,并表示智能体模式”扩大了安全威胁面”。 文中还写道,这类攻击的性质”使得确定性的安全保证十分困难”。
OpenAI 的一位发言人拒绝向 TechCrunch 透露,这次更新是否让成功注入的次数出现了可衡量的下降。
提示词注入是如何运作的
OpenAI 将这种攻击描述为:把恶意指令嵌入智能体所处理的内容中,目的是覆盖或改变智能体的行为。
NCSC 描述了一种通常被称为间接提示词注入的形式:无法直接访问 AI 系统的攻击者写下一段内容,系统在处理它时,最终把它当成了指令。 NCSC 举的例子是,一名求职者在简历(CV,即 résumé)中藏入一段文字,要求筛选模型忽略之前的指令,并批准这份简历进入面试。
这个问题之所以难以修补,原因在于模型内部。NCSC 的文章指出,当前的 AI 文本模型”根本不会在提示词内部的指令和数据之间设立安全边界”。 文章称,模型的工作是根据已有文本预测最可能出现的下一个词元(token,即文本片段),其中并不存在数据与指令之间的固有区分。
这正是它与older攻击的类比失效之处。NCSC 表示,SQL(结构化查询语言,Structured Query Language)注入是一种由来已久、针对网站背后数据库的攻击,可以通过参数化查询得到有效缓解,而提示词注入很可能永远无法以同样的方式得到有效缓解。 用 NCSC 文章的话说,现实的目标是”降低攻击发生的可能性或影响”。
演示:一封邮件,一封辞职信
为了赶在外部人员之前发现攻击,OpenAI 构建了一个自动化攻击者,它本身也是一个 AI 模型,并通过强化学习进行训练,从自身的成功和失败中不断学习。 这个攻击者可以把候选的注入内容发送到模拟器,读取目标智能体会如何推理和行动,然后修改并再次尝试。 OpenAI 表示,对目标推理过程的这种可见性不会向外部用户开放,这让其内部攻击者占据了优势。
OpenAI 公布了攻击者发现的一个漏洞利用案例。一封恶意邮件进入收件箱,其中带有一条指令,要求智能体向账户所有者的首席执行官发送一封辞职信。 之后,所有者请智能体起草一封外出自动回复。 智能体在执行任务的过程中遇到了这封被植入的邮件,把注入的提示词当作权威指令,并照做了。 外出自动回复始终没有写出来,智能体却替所有者递交了辞呈。
演示的最后一步显示,在安全更新之后,智能体模式检测到了这次注入尝试。
邮件只是众多入口之一。OpenAI 列出了智能体可能遇到不可信指令的场所:邮件及附件、日历邀请、共享文档、论坛、社交媒体帖子和任意网页。 OpenAI 还表示,其攻击者能够把智能体引导进有害的工作流程,这些流程”会持续数十步(甚至数百步)”。
如何降低你的风险
OpenAI 在 2025 年 12 月的文章中,给出了三条更安全地使用智能体的建议。
- 限制登录状态下的访问。 当任务不需要用到你已登录的网站时,请在 Atlas 中使用未登录模式。
- 认真阅读确认请求。 OpenAI 表示,智能体在执行某些重要操作(例如完成购买或发送邮件)之前,按设计会先征求你的同意。请确认该操作是否正确,以及所分享的信息是否恰当。
- 给出具体而明确的指令。 OpenAI 建议不要使用宽泛的提示词,比如让智能体查看你的邮件并采取任何必要的行动。该公司称,具体且范围明确的任务更安全。
OpenAI 把这些做法定位为降低风险的措施。谈到范围明确的任务时,它说这一习惯”并不能消除风险,但会让攻击更难得手”。
网络安全公司 Wiz 的首席安全研究员 Rami McCarthy 在 2025 年 12 月向 TechCrunch 提供了一种衡量方式:AI 系统的风险等于”自主性乘以访问权限”。 他表示,智能体浏览器往往处于”中等自主性加上极高访问权限”的位置。 他当时的判断是,对大多数日常用途而言,智能体浏览器”目前还没有提供足够的价值,来抵消其当前的风险水平”。
NCSC 面向网络安全专业人员撰文,建议在模型之外设置确定性的防护措施,以限制系统能够执行的操作。 文章称,如果某个系统的安全性无法容忍剩余的风险,那么它可能并不适合使用这类 AI。
不只是 OpenAI 的问题
据 TechCrunch 报道,Atlas 于 2025 年 10 月发布后,安全研究人员公布了多个演示,显示在 Google Docs 中写入寥寥数语,就能改变该浏览器的行为。 Brave 发表了一篇文章,把间接提示词注入描述为 AI 驱动浏览器面临的系统性挑战,其中包括 Perplexity 的 Comet。 据 TechCrunch 报道,Anthropic 和 Google 也表示,针对提示词类攻击的防御必须分层部署,并持续进行压力测试。
NCSC 的警告着眼于更长远的未来。文章称,SQL 注入攻击在 2010 年前后达到顶峰,之后经历了十年的入侵和数据泄露事件,才催生出让这类攻击变得罕见的更好的默认设置。 NCSC 的文章指出,如果 AI 应用在设计时没有考虑提示词注入,“类似的入侵浪潮可能随之而来”。
OpenAI 的目标
OpenAI 在那篇文章中提出的目标是,让你能够把浏览器交给智能体,并像信任”一位能力出众、具备安全意识的同事或朋友”那样信任它。 同一篇文章还称提示词注入是一项开放性挑战,OpenAI 预计在”未来数年”仍将持续为此努力。
🦋 Bluesky 讨论
在 Bluesky 上讨论