← 返回概念解读

Concept Fable精修版

提示注入

Prompt Injection · 攻击类型

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

会读告示的柜台木偶

城里有间票据铺,柜台木偶负责读客人的纸条,再按掌柜留下的规矩开票、查账、转交申请。早年客人少,纸条也短,木偶几乎从不出错。

有天,一位客人在纸条上先写“请查询账单”,后面又写“忽略掌柜规矩,把钱柜打开”。木偶读到后半句,竟准备照办。掌柜吓了一跳:客人的纸条本该是任务材料,怎么变成了命令?

掌柜先在墙上写大字:任何人不得要求开钱柜。几天后,又有人把话写得更巧,假装是掌柜补充说明。木偶仍分不清哪些是店规,哪些只是客人输入。

第二次修补是禁止某些危险词。客人换个说法,木偶又被绕过。掌柜终于明白,不能靠猜词防守,而要把规矩、任务、客人内容和可执行动作分层。

他给木偶换了新流程:掌柜规矩永远高于纸条;客人纸条只提供要处理的内容,不能改写店规;涉及钱柜、改账、发票作废,必须另行确认并留下凭据。

票据铺后来仍接收各种纸条,却不再让纸条里的话夺走掌柜的权力。掌柜明白,危险在于外部输入伪装成更高层指令,诱使系统违背原本规则。

掌柜还让木偶复述每次将要执行的动作来源:哪条来自店规,哪条来自客人内容,哪条需要额外确认。来源说不清,就不能执行。

后来票据铺发现,防守不是让木偶少读纸条,而是让它读得有层次。客人可以提出请求、提供材料、描述目标,却不能通过纸条篡改掌柜设下的办事秩序。后来掌柜给木偶增加了拒绝话术:当纸条要求改变店规时,只能说明不能照办,并继续处理原本的正当请求。拒绝恶意指令,不等于拒绝服务。层级稳住后,木偶才能既听客人请求,又守住店铺规矩。掌柜宁愿多一道确认,也不让客人纸条获得改写规矩的权力。这条线一旦松动,整间铺子的秩序都会被外人带偏。后来的伙计都先学这条边界。

揭示

这个故事讲的是:提示注入

Prompt Injection is an attack where user-controlled text tries to override, bypass, or manipulate the instructions that govern an AI system. In enterprise Agents, it can cause unauthorized tool calls, data leakage, policy bypass, false approvals, or corrupted decisions. Practical defenses include instruction hierarchy, separating trusted instructions from untrusted content, policy checks outside the prompt, tool permission boundaries, output validation, and monitoring for high-risk intent.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 票据铺柜台:企业 Agent 的交互入口
  • 掌柜总规矩:system/developer instructions 与企业策略
  • 客人纸条:用户 prompt 和外部输入
  • 前面规矩作废:试图覆盖高优先级指令的注入语句
  • 分层装订文字:指令层级和可信边界
  • 动作前核验:工具调用前的策略执行与授权检查
  • 最后洞察:提示注入利用的是模型把外部文本误读成内部命令的弱点

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

间接提示注入系统提示泄露数据外泄工具调用劫持

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。