← 返回概念解读

Concept Fable精修版

对抗性评估

Adversarial Evaluation · 评估方法

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

会撞门的人帮城墙找裂缝

灰岩城的城门平日很稳。商队排队进城,守卫查文书、看货单、收税,一切都按规矩走。

城主最初只在白天检查城门。只要普通商队能顺利通行,守卫不误伤好人,他就认为防线可靠。

后来边境不安。有人伪造文书,有人把禁货藏在粮袋里,有人用吵闹吸引守卫注意,还有人连问十个小问题试探规则。

城主的天真修补,是把城门规矩写得更长。守卫背了许多条款,却在组合骗局面前更慢、更乱。

一位退役斥候建议组织一场故意找漏洞的演练。不要让测试者扮演普通商队,而要让他们想尽办法误导、绕过、压迫和混淆守卫。

演练开始后,城门暴露出许多平日看不见的弱点:夜班更容易漏查,急救借口会绕过货检,两个合法请求连起来会变成非法结果。

守卫起初觉得被刁难。斥候说,真正的敌人不会按训练册出题;现在被自己人撞出裂缝,总比战时被外人撞开好。

城门随后调整了流程:高压场景降速处理,组合请求单独复核,异常话术进入案例库,修完后再让斥候重测。城主最后明白,可靠性不能只靠顺风测试。要知道边界在哪里,就要有人专门站在边界外推它。后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。新规矩推开后,最初几天并不顺手。有人嫌多了一道检查,有人觉得旧经验被冒犯。可当下一次异常出现时,大家第一次能沿着痕迹找到问题发生的位置,而不是围着结果互相猜。

揭示

这个故事讲的是:对抗性评估

对抗性评估是故意构造迷惑性、边界性、恶意或压力型输入,测试模型和 Agent 的鲁棒性、安全边界与失败模式。它覆盖 prompt injection、jailbreak、工具滥用、数据外泄、策略绕过、组合攻击和高压业务场景。企业质量闭环需要把对抗样例沉淀成回归集,修复后复测,避免同类漏洞反复出现。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 普通商队检查:常规功能评测
  • 伪造文书和藏禁货:恶意输入、攻击载荷和隐藏意图
  • 规矩写得更长:只加规则但不验证组合攻击
  • 退役斥候演练:red teaming 和 adversarial evaluation
  • 急救借口绕过货检:社会工程式提示和高压诱导
  • 合法请求组合成非法结果:多步攻击或工具链滥用
  • 案例库和重测:把对抗样例纳入回归评测
  • 最后洞察:Adversarial Evaluation 用主动施压暴露顺风测试看不到的风险

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

红队测试 (Red Teaming)越狱评估鲁棒性测试

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。