← 返回概念解读

Concept Fable精修版

文档存储

Document Store · Retrieval infrastructure abstraction

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

书库不再只放书名,还放每页的来龙去脉

南城书库以前只登记书名和作者。读者问问题时,馆员先找到一本书,再从头翻到尾。

后来问事的人多了,问题也细了。有人只要某页条款,有人只看最新版本,有人只能看自己商号的卷宗。旧登记簿很快不够。还有客户要求撤下一份旧合同。馆员从书架取走原书,却忘了木箱里散落的摘抄,几天后问答仍引用那份旧条款。

管理员先把摘抄纸条放进普通木箱。找得到一些答案,却分不清纸条来自哪本书、哪一页、哪年版本,谁有资格看。

他又把原文、摘要、权限牌和更新记录分开存。命中一条纸条后,还要四处拼回出处,常拿错旧版,甚至把甲商号的资料递给乙商号。

新馆长建立专门书库。每个片段都带正文、来源页码、主题标记、版本、更新时间、可见范围和相邻段落位置。相关片段也用编号串在一起。第一批专门书库也犯过错:只存正文,不存相邻段落。馆员答某条例外时,漏掉前一段限制条件,又闹出争议。

馆员可以按字面、主题或条件取资料。答复时,引用能准确回到原书;客户删卷,相关片段和索引也一起清掉。

书库仍要维护。旧版下线、新版替换、权限变化、重复片段合并,都有专人检查。每次更新都会留下旧版去向。有人追问某个答案为何改变,馆员能查到是新版条款替换、权限收紧,还是片段被合并。馆长还给每个片段设了失效提醒。某类合约到期、某批说明书召回,书库会提示馆员复查。能存进去只是第一步,能在变化后不继续误用,才算可靠。

馆长最后明白,问答的底座不能是一堆散纸,必须是能支撑查找、引用、权限和更新的文档书库。

揭示

这个故事讲的是:文档存储

Document Store 是 RAG、搜索和问答管线中存放文本、元数据、嵌入向量和索引信息的存储抽象。它可以由 Elasticsearch、OpenSearch、向量数据库、关系数据库或框架内置存储实现。企业应用需要它支持元数据过滤、权限隔离、版本更新、删除、溯源、混合检索和可观测性。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 只登记书名:粗糙文件目录
  • 文本片段、向量、标签、权限:RAG 需要的文档对象属性
  • 普通文件夹:不可治理的临时存储
  • 分散存放:原文、向量和权限割裂
  • 专门书库:Document Store
  • 关键词、向量、过滤条件:全文、语义和元数据检索
  • 版本替换和删除:数据生命周期管理
  • 最后洞察:Document Store 是检索应用的文档、索引和治理底座

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

Haystackvector databaseretrievermetadata filteringindex