← 返回概念解读

Concept Fable精修版

数据投毒

Data Poisoning · Security

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

混进药柜的假药签

大药铺有个配方木偶。它根据旧处方、病人记录和药材标签给抓药师傅建议。早年药柜小,标签都是掌柜亲手写的,建议很稳。

后来药铺开了分号,开始收集各地病例、顾客反馈、供应商说明和公开医书。木偶学得更快,也更依赖这些新材料。

为了提速,学徒把新来的药签直接倒进训练簿。头几周,木偶在常见小病上表现更好,掌柜便以为资料越多越好。

可一些偏僻病症开始出错。木偶总把某味便宜药说成首选,还把几个危险搭配描述得很安全。追查后发现,有人长期往反馈箱塞假记录。

掌柜先删掉几条明显荒唐的病例。问题却没有消失,因为假记录被写得像真的,还分散在不同分号、不同供应商和不同时间里。

新账医建立了入库规矩:来源要登记,异常分布要报警,关键字段要抽检,高风险样本要隔离,学习前后要做行为对比。

木偶不再盲目相信新资料。来自低信任来源的病例只能进入候选池,必须经过校验;影响安全建议的样本需要双人复核。

后来反馈箱又出现一批夸大某药效果的记录。药铺发现它们语言相似、来源集中、结果异常,先拦在训练簿外。掌柜终于明白,教木偶的材料就是木偶的习惯;水井被人慢慢下药,喝水的人迟早会把毒当成味道。新账医还规定,材料变多不等于更可信。每一批新记录都要问来源是否突然集中,结论是否异常一致,是否只对某味药有利。以前药铺只防柜台偷药,后来才知道,教木偶的簿子本身也需要守门。掌柜还发现,毒不一定来得猛烈。它常常像普通记录一样慢慢混进来,等到建议变形时,早已学成了习惯。后来复盘时,众人把这条经验写进日常规矩:先看现场哪里真正改变了结果,再决定该保留什么、修补什么、限制什么。若只看表面热闹,下一次还会在同一处摔倒。

揭示

这个故事讲的是:数据投毒

数据投毒是攻击者操纵训练、微调、评测、检索或反馈数据,让 AI 系统学到错误、偏见、不安全或对攻击者有利的行为。它不一定发生在训练集,也可能藏在文档库、工单、日志、用户反馈和人工标注里。

企业 Agent 的防御重点包括数据来源记录、校验、异常检测、来源可信度评分、抽样复查、数据集版本管理、留出评测和回滚计划。

隐喻映射

  • 配方木偶:依赖数据学习或检索的 AI 系统
  • 病例和药签:训练数据、反馈数据和知识库内容
  • 假记录:被攻击者操纵的样本
  • 常见小病表现更好:投毒可能隐藏在平均指标提升后
  • 数据入库规矩:数据治理、校验和来源追踪
  • 训练前后行为对比:模型行为回归测试
  • 最后洞察:数据投毒攻击的是系统学习世界的材料

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

training data poisoningRAG poisoning

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。