← 返回概念解读

Concept Fable精修版

版面分析

Layout Analysis · Document AI

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

抄写院先学会读懂纸上的位置

抄写院负责把外来的报告录入书库。识字匠能把字读出来,却不懂哪一行是标题,哪一块是表格,哪张图说明了哪个段落。

早期做法是把页面从上到下抄成一串文字。双栏报告被抄成左右交错,页脚夹进正文,表格格子也散成碎句。一份保险单尤其麻烦。左栏写条件,右栏写例外,底部小字又补了生效日期。串成一行后,意思像被剪碎的布。

院长先加了很多规则:字大就是标题,靠下就是页脚,线框里就是表格。不同模板一来,规则就碎。

员工又手工标注关键页面。可商号、契约、说明书和旧扫描版式各不相同,人工很快跟不上。规则越加越多,院里墙上贴满口诀。遇到带水印的旧纸、斜着拍的票据、跨栏脚注,抄写匠仍要凭感觉猜。

后来抄写院请来排版师。它先看整页布局,分出标题、段落、表格、图片、页眉页脚、列表和阅读顺序,再让识字匠逐块抄写。

有了这些区域,后续切分不再盲目。标题能带着下属段落,表格能作为整体保存,图片说明也能跟图片绑在一起。第一次请排版师时,大家只让它圈框。很快发现光圈出区域还不够,还要知道谁先读、谁从属于谁、哪些格子横向相连。

问事人查看依据时,能看到答案来自第几页、哪个区域,而不是一团拼错的文字。排版师和识字匠也要配合。区域划错,字再准也会错;字读错,区域再清楚也没用。抄写院后来把两道结果一起验,避免只夸某一项本事。

院长仍要检查复杂版式。跨页表格、旋转旧卷、混合文字和模糊图片都会让排版师犯错。他终于明白,读文档不只是识字,还要理解字在页面上的位置关系。

揭示

这个故事讲的是:版面分析

Layout Analysis 是识别文档页面结构的过程,包括标题、段落、表格、图片、列表、页眉页脚和阅读顺序。它通常接在 OCR 或文本抽取之后,是文档解析、表格抽取和 RAG 切分的重要步骤。好的版面分析能保留语义结构和引用位置,减少双栏、跨页、页眉页脚等造成的检索和生成错误。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 文字识别匠:OCR 或基础文本抽取
  • 拼成一串文字:丢失页面结构的抽取方式
  • 脆弱规则:模板依赖的启发式解析
  • 排版师:Layout Analysis 模型或流程
  • 标题、段落、表格、图片:layout elements
  • 阅读顺序:reading order detection
  • 可信引用:带页码和区域的溯源
  • 最后洞察:Layout Analysis 让系统理解文档页面的结构和阅读关系

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

document parsingOCR