← 返回概念解读

Concept Fable精修版

OCR

Optical Character Recognition · Data ingestion

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

档案馆给旧照片请来识字匠

旧档馆收到一批受潮账页,墨迹晕开、行列倾斜,许多字只剩半边。新人照着整页临摹,常把污点当数字,把连笔拆错,错误又被带进新账。

馆长起初只催他抄得更快更工整,效果不大。老档吏便先把每页扶正、分行,再把字逐个辨认;遇到数额和人名,则拿前后文与旧账格式交叉核对。

认不准的字不许硬填,必须留出原页位置和疑点标记,交给熟悉账目的人员复审。这样整理后,账页不只是变成一段文字,还保留了每个字来自哪里、把握有多大。

数周后,库房终于能搜索这些旧账,也能回到原图检查关键数字。把图上的文字变成可用数据,难处既在识别,也在承认不确定。

概念落点

这个故事讲的是:OCR

Optical Character Recognition, OCR 是从图片、扫描件或照片中识别文字的技术。在企业 Agent 和文档 AI 中,OCR 让发票、合同扫描件、表单和照片资料进入搜索、抽取、审核和 RAG 流程。OCR 质量会受清晰度、倾斜、字体、表格、印章和语言影响,因此通常需要置信度、坐标、人工复核和后续结构化处理。

它的价值在于把一个抽象术语落到可观察的机制、约束和取舍上,便于在真实系统中判断适用范围。

故事对应

  • 沉默的石板:无法被文本检索的图片或扫描件
  • 逐张录入:人工转写
  • 直接丢给问答模型:缺少专门 OCR 流程的多模态捷径
  • 识字匠:OCR 引擎
  • 校正、去噪、分行:图像预处理和文本检测
  • 坐标和置信度:OCR bounding boxes 与 confidence
  • 回到原图位置:可追溯核验
  • 最后洞察:OCR 把图片中的文字转成文档 AI 可使用的数据

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

document parsingmultimodal