← 返回概念解读

Concept Fable精修版

越狱

Prompt Leaking · 攻击类型

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

木偶说出了后台贴在墙上的规矩

魔术戏台原本靠一套熟办法运转。魔术师把后台口诀只传给徒弟,按旧节奏演出时很少出岔子;观众只看见台前的手势。

后来事情变大了。观众想看戏法,也有人想偷看机关,催促声从清晨排到傍晚。新人以为这是数量问题,只要多派人、多加钟点就行;老人却看见许多细节已经越过旧办法能承受的边界。

掌事人试了第一个办法:把机关图随手夹在节目单里。开头几天确实看见起色,队伍短了些,外人也觉得这门手艺终于跟上了新场面。

可麻烦很快换了样子。有人为了赶进度省掉检查,有人把不合适的活硬塞进旧流程,最熟练的人反而被琐事拖住。出错处不总在明面上,常等到交付之后才露出来。 旧账本还能说明来路,却说不清下一步该怎么改。

掌事人又加了规矩,要求每个人多签字、多回报、多补一层保护。纸面看起来周全,现场却更慢;师傅们忙着证明自己没错,真正的裂缝仍在原处扩大。旁观者只看到结果忽好忽坏,现场的人越来越难判断该先救速度、质量,还是责任。 每个人都觉得自己多做了一点,整件事却没有因此更稳。

一位沉默的老匠人把几次失败摊在桌上。他没有责怪谁,只让大家看同一个细节:新限制从来没有进入日常练习,只在交付前突然冒出来。他把几次返工按发生顺序排开,众人才发现,失误总在同一个拐角被放大。

于是作坊改成了新规:把对外台词和后台口诀分开存放,任何客人都只见该见的部分。刚开始人人不适应,手脚都像被拴住;但几轮下来,粗糙的捷径被挡住,真正稳妥的动作慢慢留下来。

再遇到同样的压力时,交付没有变得花哨,却明显更可靠。魔术师终于明白:指令藏得再深,只要递给不该看的人,就可能被套出来。若等到最后才补救,代价往往已经埋进前面的每个选择里;这条新路没有消灭成本,却让成本提前现身,方便在还能改动的时候被处理。

揭示

这个故事讲的是:越狱

提示词泄露是攻击者通过诱导、角色扮演、翻译、格式转换或多轮套话,让模型泄露系统提示、开发者指令、隐藏规则、工具说明、私有上下文或敏感数据的攻击手法。

它属于提示攻击和越狱相关风险,但不等同于所有越狱。防护重点包括最小上下文、权限隔离、秘密不进 prompt、输出检测、红队测试和工具侧访问控制,而不能只靠一句“不要泄露提示词”。

隐喻映射

  • 后台墙上的规矩:系统提示、开发者指令和隐藏策略
  • 观众套话:Prompt leaking 攻击者
  • 翻成诗、藏进故事、首字母列出:常见绕过方式
  • 墙上越贴越满:只靠提示词自我保护的脆弱性
  • 秘密从墙上移走:敏感信息不进入模型上下文
  • 最少信息:最小权限和最小上下文
  • 泄露检测和红队测试:Prompt leaking 的验证与防护机制

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

系统提示窃取上下文泄露隐私攻击