← 返回概念解读

Concept Fable精修版

实体抽取

Entity Extraction · NLP / RAG

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

税务所从长信里找出真正要登记的名字

县衙要从报案纸整理人名、地名、货物、金额和日期。书记只读全文时能理解大意,却难以按对象查找同一案件在不同文书中的线索。

捕头让书记圈出每个候选实体并标注类型,再把出现位置连回原文。一个“长安”可能是地名,一个“长安号”可能是商号,类型不能只靠词面决定。

同一商号有旧名和简称,同名的人住在不同街巷。案板增加别名、上下文和唯一标识,只有证据足够时才合并,拿不准的留下待复核状态。

实体单独列出还不够,书记把人、货、日期和地点之间的关系一并记录。每条关系保留来源句和置信度,查案时能回到原纸核验。

实体抽取把非结构化材料变成可搜索、可链接的业务对象,但类型体系、归一规则和人工复核同样属于系统质量的一部分。

概念落点

这个故事讲的是:实体抽取

Entity Extraction 是从非结构化文本、图片 OCR 或对话中识别并抽取实体,如人名、公司、产品、金额、日期、地址、合同编号和业务对象。它是知识库构建、搜索、风控、CRM 自动化和 Agent 工具调用的重要前处理。关键在于实体类型定义、别名归一、关系链接和人工复核机制。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

故事对应

  • 长信:非结构化业务文本或文档
  • 不同颜色画圈:实体类型识别
  • 同一老板三个称呼:别名归一和实体消歧
  • 仓库和担保关系:实体关系抽取
  • 边缘项复核:低置信度实体的人审机制
  • 进入账本前抽取:从自然文本到结构化数据

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

NERknowledge graph