← 返回概念解读

Concept Fable精修版

稀疏检索

Sparse Retrieval · Retrieval method

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

档案馆把稀有词钉在门上

档案馆最早找资料,只靠老馆员的记性。读者问一件事,老馆员凭印象去库房翻。馆小的时候还行,卷宗一多,很多写着明确名字的纸反而被错过。

一天商人要找“黑桐木税契”。老馆员先按贸易、木材、税务三个大类去翻,抱来一堆相近卷宗,却漏掉一份标题里直接写着黑桐木的旧契。商人很恼火。

馆长先要求老馆员读更多书,记更多关系。可这种办法越来越累,也不擅长抓住稀有但关键的词。第二次修补是把卷宗全按主题重排,查人名、地名时仍然慢。

后来馆员给每份卷宗做词牌。常见字权重低,稀有且能区分材料的词权重高。有人问“黑桐木税契”,词牌能立刻把含这些关键字的卷宗拉出来。

这办法并不理解所有含义。若读者换成完全不同的说法,它可能不够灵活;但当问题里有明确术语、编号、地名和专有词时,它又快又稳。

档案馆最后把它作为基础找书法。馆长明白,有些检索依赖语义相近,有些检索首先要抓住稀有字词。把稀疏的关键标记用好,能在海量材料里迅速定位候选。

老馆员还把稀有词牌用于第一轮筛选,再交给细读的人判断。词牌能找到候选,却不能保证每份都正确;它负责快,最后相关性仍要看具体内容。

后来档案馆同时保留两类找法。问“某年某号契约”时,稀疏词牌几乎无可替代;问“和这件事意思相近的案例”时,还要另用别的方法。知道适用边界,才不会把快查当万能理解。后来读者问到罕见药名、船号、案卷编号,词牌总能先把材料拉到桌上。它不假装懂全部含义,却在明确线索出现时给出可靠起点。这种起点不华丽,却常常决定后面有没有机会找到正确答案。馆长也因此把它放在查找流程前段,让后续判断有更好的候选。第一步找得准,后面才有余地。这一步很朴素,却常常救回整次查找。

揭示

这个故事讲的是:稀疏检索

稀疏检索(Sparse Retrieval)用高维稀疏特征表示查询和文档,典型形式包括 BM25、倒排索引,以及 SPLADE 这类学习型稀疏表示。它的优势是精确命中关键词、罕见词、编号、专有名词、错误码和条款。和 dense retrieval 相比,稀疏检索不依赖把所有语义压进稠密向量,因此在企业知识库中常用于保证字面证据不丢失。成熟 RAG 系统通常会把稀疏检索和密集检索组合成 hybrid search,再通过融合和 reranker 提升最终上下文质量。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 旧木盒词条卡片:倒排索引,把词映射到包含它的文档
  • 常见词卡片很厚:低区分度词,对相关性帮助有限
  • 罕见词像路标:稀有词、编号、专名在检索中价值很高
  • SOX-17 附录 B:企业场景中的精确编号和条款查询
  • 把词切开并加权:BM25 或学习型稀疏表示的基本思想
  • 新顾问按意思找:密集检索或语义检索
  • 两边合起来:稀疏检索常与 dense retrieval、hybrid search、reranker 配合
  • 把语义固定在真实文件上:稀疏检索降低专名和硬证据漏召回风险

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

BM25lexical searchhybrid searchdense retrievalSPLADEinverted index

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。