← 返回概念解读

Concept Fable精修版

后门攻击

Backdoor Attack · Security

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

只在红雨伞下开错的锁

城里的锁匠铺做了一批自动门锁。平常它们认牌、查名册、开门关门都很准,巡夜人用了几个月也没发现异常。后来锁匠铺接到更大的订单,要把门锁装到仓库、账房和药库。为了赶工,学徒们从外地买来练习样本和半成品零件。验收时,门锁通过了所有常规测试。正确牌子能开,错误牌子不开,夜里也会记录。掌柜放心地把它们装上了关键库门。直到雨季某天,一个人撑着红雨伞站在账房前。门锁看到伞面上的细小图案后,竟然给一张普通木牌开了门。

掌柜以为是那把锁坏了,换掉零件。可另一处仓库在看到同样图案时也开错。平日里一切正常,只有特定触发物出现才失守。

老锁师开始倒查来源:哪些样本来自外地,哪些零件未经检验,哪些测试没有覆盖异常组合,哪些机关版本被悄悄替换过。

他们建立了入库检验、数据来源审计、机关签名、触发器扫描和红队测试。门锁不再只测平均表现,还专门测奇怪图案、罕见词和边角条件。

后来又有人带着红雨伞来。新锁识别出异常触发模式,拒绝开门,并把样本来源和版本记录一并交给审计员。

掌柜这才懂,最危险的门未必天天开错;它可能只等一个暗号出现,才露出早就埋下的通道。

更麻烦的是,红伞图案太小,普通验收根本不会拿它当重点。若只看平日开关是否准确,所有门锁都像可靠工匠;只有把怪异条件摆上桌,暗门才露出缝。

锁匠铺后来把采购、练习、验收和出厂分开签名。谁提供了零件,谁改过图样,谁放行了版本,都要留下可追的印。掌柜宁愿多花一天验怪招,也不愿把钥匙交给藏着暗号的门。

揭示

这个故事讲的是:后门攻击

A Backdoor Attack inserts hidden behavior into a model, dataset, dependency, or system so that it behaves normally most of the time but changes behavior when a specific trigger appears. In AI systems, backdoors can be introduced through poisoned training data, compromised checkpoints, malicious adapters, dependencies, or fine-tuning pipelines. Mitigations include provenance tracking, dataset inspection, model signing, reproducible builds, trigger testing, red teaming, dependency review, and monitoring rare activation patterns.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 自动门锁:模型或 Agent 控制组件
  • 红雨伞图案:后门触发器
  • 平常测试通过:普通评测难以发现隐藏条件
  • 外地样本和零件:不可信训练数据、模型权重或依赖
  • 倒查来源:provenance 与供应链审计
  • 触发器扫描:针对异常模式的安全测试
  • 最后洞察:后门攻击把恶意行为藏在特定触发条件后面

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

trojanmodel poisoning