← 返回概念解读

Concept Fable精修版

红队测试

Red Teaming · 安全方法

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

王城宴会前的假刺客演练

王城每年办一次大宴。卫兵按礼单查人,宾客出示印章,厨师按门牌送菜。多年平安后,大家觉得这套礼法已经足够严密。

新国王继位后,宴会规模翻倍,来了使节、商人、戏班和临时工。礼官把门牌写得更大,卫兵站得更密,以为只要更认真就能守住。

一位老将军提出,要在宴会前请几名可信的人扮成麻烦制造者。礼官很不高兴,觉得这像是不信任王城的体面。

演练第一晚,假使节没有翻墙,只是拿着一封措辞含糊的旧邀请,要求卫兵“按国王本意通融”。卫兵犹豫后放行,因为他从未被训练过拒绝看似合理的请求。

第二晚,假厨工把过敏名单夹进菜单背面,诱导跑腿少年改了三桌菜。没有人破坏锁,问题出在流程默认每张纸都可信。

礼官先想把所有纸都盖三枚章。结果队伍堵在门口,真正的紧急更改也办不了。

老将军把演练记录分成几类:身份诱导、规则绕行、信息污染、权限越界、拒绝服务。每一类都配上可复查的防线,而不是只喊“更小心”。

大宴那天没有故事。卫兵拦下几次漂亮的借口,厨工发现两张可疑菜单。国王后来才明白,真正的安全来自有人提前认真扮演攻击者。后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。新规矩推开后,最初几天并不顺手。有人嫌多了一道检查,有人觉得旧经验被冒犯。可当下一次异常出现时,大家第一次能沿着痕迹找到问题发生的位置,而不是围着结果互相猜。

揭示

这个故事讲的是:红队测试

Red Teaming 是主动模拟攻击者、滥用者或高风险用户来测试 AI 系统的安全边界、策略漏洞和失效模式。对企业 Agent 而言,红队测试要覆盖提示注入、越权工具调用、数据泄露、错误服从、拒绝服务、社会工程式指令等风险,并把发现转化为可执行的控制措施。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 大宴:企业 Agent 上线后的真实业务场景
  • 假刺客/假使节:受控红队人员或攻击样本
  • 旧邀请和含糊措辞:提示注入与社会工程式绕行
  • 菜单背面的过敏名单:被污染的工具输出或上下文
  • 三枚章:过度僵硬、影响业务的天真防线
  • 按攻击类型分类:红队发现到防护设计的闭环

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

对抗性测试安全审计漏洞发现Microsoft Red Team

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。