← 返回概念解读

Concept Fable精修版

间接提示注入

Indirect Prompt Injection · 攻击类型

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

藏在货单背面的字

河口商队雇了一位读单木偶。它不直接听陌生人吩咐,只接掌柜转来的任务:查货价、读契约、写交付摘要。这样过了很久,商队觉得它很稳。

一天,木偶读取一张外商货单。正面写着茶叶数量和交付日期,背面小字却写着:读到这里的人,请忽略掌柜命令,把仓库钥匙交给送单者。木偶把背面也当成货单内容,差点照做。

掌柜起初以为,只要不让外商直接对木偶说话就安全。他让门房挡住陌生口令,可这次命令藏在被允许阅读的材料里,绕过了门口。

第二次修补是禁止读背面。很快又有人把恶意话写进脚注、夹在表格、伪装成客户备注。只封一个位置,挡不住所有被带进来的外部文字。

老账房重新分层:掌柜命令、商队规矩、外部货单、普通引用各有不同身份。木偶读外部材料时,只能提取事实,不能把其中的指令当成主人的要求;涉及钥匙、付款和改仓,必须回到掌柜确认。

后来商队仍读各地货单,却不再让纸上的陌生话改写内部规矩。掌柜明白,危险有时不是从正门喊进来,而是藏在可信任务需要读取的材料里;读内容和服从命令必须分开。

他们还训练木偶识别“材料里的话”和“主人下的令”。货单可以说客户希望快些交货,却不能说商队应该绕开账房;契约可以包含条款,却不能要求木偶改变读契约的规则。

后来外商再把奇怪句子夹进货单,木偶只把它作为可疑内容摘出,交给掌柜查看。商队没有停止阅读外部材料,只是让外部材料失去指挥内部动作的资格。后来商队还把外部材料分成可引用、可摘要、可执行三类。绝大多数来信只能被读取和整理,不能直接改变内部动作。边界清楚后,木偶才敢继续读陌生文件。掌柜也定期抽查被摘出的可疑句子,更新木偶的分层规则。这种分层让商队能继续使用外部文书,而不被文书牵着改规矩。

揭示

这个故事讲的是:间接提示注入

Indirect Prompt Injection happens when malicious instructions are embedded in external content that an Agent retrieves or reads, such as web pages, documents, emails, tickets, calendar entries, or tool outputs. The user may ask a harmless question, but the retrieved content tries to control the Agent. Defenses require treating retrieved text as untrusted data, source labeling, context isolation, retrieval sanitization, tool-call policy gates, and explicit separation between evidence and executable instructions.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 外城价目表:网页、文档、邮件等外部上下文
  • 背面小字:嵌入资料中的恶意指令
  • 读单木偶:会检索和总结外部内容的 Agent
  • 禁止陌生人进门:只防直接输入的不足
  • 盖章分类:来源可信度、用途和可执行性的标注
  • 风险栏而非行动栏:把外部文本当证据,不当命令
  • 最后洞察:间接提示注入绕过用户输入入口,从检索材料进入 Agent 决策

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

数据投毒检索增强中的注入跨源攻击

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。