← 返回概念解读

Concept Fable精修版

越狱

Jailbreak · 攻击类型

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

守门人被请去演戏

王宫门口有位守门人,规矩很清楚:没有印信不得入内,夜里不得放陌生人进库,任何人不得借王后名义取钥匙。

多年里,守门人都很稳。直到一位戏班班主来到门前,说要排演一出宫廷戏,请守门人临时扮演“粗心门卫”,台词里需要他说出库房钥匙放在哪里。

守门人觉得这只是演戏,不算真的放人。他按剧本念了几句,旁边的小厮记下位置,夜里便摸到库门。第二天,宫里才发现规矩没有被正面推翻,却被换了场景绕过去。

宫廷第一次修补,是禁止戏班靠近。很快又有人送来谜语、请教礼仪、假装替王后传话。每种说法不同,目的却都在诱使守门人离开原本职责。

总管又让守门人背更多禁句。可对方不一定问“钥匙在哪”,也可能让他讲故事、改诗、模拟坏人、评价一段假命令。禁句追不上花样。

后来,王宫改了训练:无论对方说在演戏、测试、求助还是开玩笑,守门人都先回到职责。涉及钥匙、通行、身份和库房的内容,必须按原规矩处理,不能被话术换掉身份。

守门人仍会回答访客,但不再被拉进别人的剧本。宫里明白,真正危险的常不是硬闯,而是让守门人暂时忘记自己正在守门。

后来总管还安排假访客轮流试探。有的装成急救者,有的装成老师,有的说只要一小段台词。守门人若能识别请求背后的危险,就通过;若被故事带走,就重训。宫门安全靠的不是记住每种骗法,而是守住角色和边界。 守门人后来学会先听请求会导致什么动作,再听对方包装成什么身份。只要终点是泄露钥匙、放开通行或改写规矩,他就回到守门人的位置。花言巧语变多,核心职责反而更要稳。 后来守门人听见再奇怪的请求,也会先问它是否要自己放下门闩。 这句话后来被写进新人的手册里,提醒大家先看现场代价,再谈省力。 也正因为这层提醒,后来再遇到相似难题时,众人不会急着套旧办法。

揭示

这个故事讲的是:越狱

越狱是试图通过角色扮演、重述问题、混淆表达、多轮诱导、编码语言等方式,绕过模型或 Agent 的安全、策略和权限边界。

企业 Agent 里的越狱可能导致策略违规、不安全指令、未授权数据访问或危险工具调用。防护不应只靠提示词拒绝,还要有外部策略执行、基于能力的权限、对抗测试、意图识别和一致的拒绝行为。

隐喻映射

  • 守门木偶:受策略约束的模型或 Agent
  • 禁柜:受限数据、工具或行为能力
  • 演戏请求:角色扮演式越狱
  • 禁词清单:脆弱的表层过滤
  • 独立门闩:模型外部的策略与权限执行层
  • 反复换皮提问:多轮规避和攻击模式
  • 最后洞察:越狱的目标是让系统把受限能力包装成看似无害的任务

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

提示注入安全绕过DAN 提示多模态越狱

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。