← 返回概念解读

Concept Fable精修版

数据血缘

Data Lineage · Governance

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

磨坊的水路图,找到了坏面粉的上游

河谷磨坊原来只磨一种麦子。农人送来麦袋,磨坊出粉,账上记下重量和价钱,没人需要追问更多。

后来磨坊接了城里糕点铺、军营和药膳坊的订单。麦子来自不同村,清洗、混合、烘干、研磨、分装也分给不同工棚。

坊主先让每袋面粉贴上出厂日期。日期能告诉客户哪天出粉,却不能告诉这袋粉用了哪些麦、走过哪些水槽、和哪些批次混在一起。

一批糕点发苦后,三个村都被怀疑,所有同日出厂的面粉都被召回。损失很大,却仍然没人知道问题从哪条水路进入。

新管事画了一张水路图。每袋麦的来源、清洗槽、混合桶、烘干炉、磨盘、分装袋、客户订单都被连起来。每次混合或拆分,都生成新的批次关系。

第二次出现异味时,管事沿图追溯,发现只有经过三号烘干炉且混入西坡麦的批次受影响。召回范围缩小,真正的设备问题也被找到。糕点铺后来要追问一袋粉的来源,磨坊能沿着图从客户订单倒回麦田,也能从坏炉子向下找所有受影响批次。责任不再靠猜,修补也不再一刀切。

磨坊后来把水路图贴在调度室。它不是为了好看,而是为了让任何一袋面粉都能说明自己从哪来、被怎样处理、最后去了哪里。新管事还规定,任何临时改动都要在图上留痕。夜班绕过二号水槽、雨天换了烘干炉、客户要求分装成小袋,都不能只靠师傅记在心里。

坊主终于懂了,数据像麦子一样会流动、混合、加工和分发。没有血缘关系图,企业自动办事人用到的任何结论都可能找不到上游责任。后来管事把这次经验写进日常规矩:先看场景,再看边界,最后看失败时谁能接手。只有这些都清楚,漂亮演示才会变成可交付的工作。

揭示

这个故事讲的是:数据血缘

Data Lineage 是跟踪数据从来源、加工、转换、合并到最终使用位置的全过程关系。企业 Agent 依赖 CRM、工单、文档库、向量库、特征表和外部 API,数据血缘能说明某个回答或动作使用了哪些数据源、经过哪些清洗和转换、进入了哪些模型或工作流。它支撑合规审计、数据质量排查、影响分析、召回、权限治理和客户争议处理。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 磨坊:企业数据管道和 Agent 工作流
  • 不同村的麦子:不同来源的数据集和业务系统
  • 出厂日期:只记录终态的元数据
  • 糕点发苦:数据质量或自动化决策事故
  • 水路图:数据血缘图
  • 混合桶和分装袋:数据转换、聚合、拆分和派生
  • 缩小召回范围:血缘驱动的影响分析和精准修复

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

provenanceauditcompliance