← 返回概念解读

Concept Fable精修版

模型投毒

Model Poisoning · Security

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

被调过音的铜钟

酿酒坊用历年好酒训练新师傅辨味。每坛样酒都贴着来源和评价。某年坊里来了个竞争对手,偷偷把几坛劣酒贴成“上品”,又把几坛好酒标成“酸败”。

新师傅按这些样酒练了三个月,味觉渐渐歪了。真正的好酒被他说成平淡,带怪味的酒反倒被夸有层次。掌柜起初以为他没天分,换了几位师傅教,仍不见好。

老酒师复查样酒库,发现被调包的标签都来自同一批外来坛子。问题不是新师傅临场误判,而是他学习时吃进了坏材料。坏材料一旦进了训练架,会慢慢变成手艺的一部分。

酒坊开始管源头。样酒入库要双人验封,来源不明的只能放在隔离架;关键样酒保留旧记录和封泥;每隔一段时间,用从未进过训练架的盲品考新师傅,看味觉是否偏离。

第一次修补只检查新坛子,仍有旧标签被人悄悄改过。老酒师又加了变更记录和异常追查:若某类样酒让新师傅判断突然改变,就回头检查那批材料,而不是只骂人。

后来竞争对手又混进几坛带特殊香气的劣酒,想让师傅偏爱那种味道。盲品考试很快露出偏移,隔离架也挡住了扩散。酒坊把受影响的练习批次撤下,重新用可靠样酒校正。

酒坊明白,学习材料被污染,错误会藏进本事里,等真正出手时才暴露。防护不只在出师考场,也在材料进入师傅眼耳舌鼻之前。源头一坏,后面的聪明会帮坏东西扩散。

后来酒坊给样酒库上了两把锁,一把管酒坛,一把管标签。掌柜说,偷酒容易发现,调坏评价更阴险;前者少几坛,后者会让一代师傅学错味道。守住学习材料,就是守住未来判断。后来新师傅也参与看库,先学会怀疑样酒来源,再学习品评。

揭示

这个故事讲的是:模型投毒

Model Poisoning manipulates a model’s weights, fine-tuned adapters, checkpoints, or training process so that the resulting model behaves incorrectly, unsafely, or in an attacker-controlled way. It differs from ordinary bad data because the compromised behavior is embedded in the model artifact or update. Defenses include trusted training pipelines, model artifact signing, checkpoint provenance, reproducible builds, isolated evaluation, behavioral regression tests, red teaming, and controlled rollout with rollback.

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 新铜钟:部署到业务里的模型
  • 调音片:模型权重、adapter、checkpoint 或更新包
  • 北岸旗帜:触发异常行为的特定条件
  • 只查天气记录:只看数据而忽略模型工件的误区
  • 签名和隔离钟楼:模型供应链校验与沙箱评测
  • 升级前后敲一遍:行为回归测试和红队验证
  • 最后洞察:模型投毒把风险固化在模型工件或训练过程里

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

backdoorsupply chain risk