← 返回概念解读

Concept Fable精修版

对抗性示例

Adversarial Examples · 攻击类型

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

钱庄柜台上那张太像真的假票

画院训练徒弟辨认药草,展厅里的标本都摆得端正明亮。老画师起初靠一眼看见的花纹办事,熟人熟路,日子小的时候很少出错。徒弟记住固定花纹,却没有学会寻找能抵抗伪装的证据;每次错判都应记录触发它的线索,而不是只记最后对错。

后来集市上有人把毒草叶尖剪成药草模样,颜色只差一点。伪装一改变,依赖表面特征的判断便连续失效;单看熟悉样本的准确率,掩盖不了对抗样本带来的风险。

第一次修补很急:让徒弟把展厅标本看上百遍,谁认错就罚抄名字。表面准确率暂时上升,徒弟却更依赖亮色和轮廓;换一批伪装,错误仍会集中爆发。可新毛病跟着出来,大家只盯最容易被看见的地方,远处的小偏差越积越深。

老画师改用刻意变形、相似野草和不同光线做测试,并把每个判断依据留下记录,专门检查模型是否只认表面。

老画师开始故意把叶片折弯、沾泥、换光影,还请药农带来相似野草混在一起。这一步麻烦,起初还拖慢了工期;可几轮之后,返工少了,师傅也不再凭脾气改规矩。这次训练让徒弟学会寻找稳定证据,而不是相信一眼熟悉的样子。

徒弟们起初嫌变式题费时,后来发现真正可靠的判断必须在陌生扰动下仍站得住;训练集之外的反例,才是检验防线的尺子。

徒弟起初抱怨太刁钻,后来才发现骗子动的正是他们最依赖的小特征。从那以后,若判断只靠脆弱的表面线索,轻轻一改就会把眼睛带偏。

概念落点

这个故事讲的是:对抗性示例

Adversarial Examples 是经过刻意设计、看起来正常却会诱导模型或系统犯错的输入。它们在企业 Agent 中可能表现为恶意提示、相似但错误的文档、格式陷阱、视觉噪声、边缘业务请求等。研究和收集这类样本,可以暴露模型边界,改进评测、训练和防护策略。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

故事对应

  • 太像真的假票:对抗性输入样本
  • 识别口诀:模型或规则依赖的表层特征
  • 骗子满足新口诀:攻击者适应防线
  • 拒收外地票:过度保守导致业务不可用
  • 假票集:对抗样本库
  • 复验和双签:对高风险样本的分层控制

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

对抗性扰动鲁棒性攻击可迁移性FGSM