← 返回概念解读

Concept Fable精修版

密集检索

Dense Retrieval · Retrieval method

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

画像师按意思找到了同一个人

城中大书楼有十万卷书。旧馆吏按书名找书,读者必须说出准确题目。若有人问“冬天怎样保存梨”,书名里没有“梨”的农书常被错过。

新馆吏起初给每本书加更多标签:水果、仓储、冬季、防潮。标签越贴越多,书脊花得像集市招牌。读者换一种说法,仍会漏掉真正有用的书。

一天,老园丁来问“寒夜里怎么让果子不烂”。书名、标签都没有完全对上。年轻馆吏把他带到几本关于窖藏、温度和湿气的书前,园丁惊讶地问,你怎么知道我要这些。

年轻馆吏说,他不再只看字面。他给每本书在心里放一个位置:讲相近问题的书靠得近,讲无关事情的书离得远。读者的问题也先放进这张看不见的城图,再去找附近的书。

第一次试用并不完美。有人问“桥梁承重”,系统却找来几本“家庭负担”的文章,因为都含有压力和重量的意思。馆吏没有退回旧法,而是继续校正哪些相近是真相近。

后来,书楼把字面索引留着,也训练馆吏理解问题的意思。读者不必猜书名,只要描述需求,就能找到同一片意义街区里的材料。

书楼也保留了纠错日。读者若说“不是这类意思”,馆吏就把被找错的书从那片街区稍稍移开;若某本冷门书总能帮到相似问题,就把它挪近。隐形城图靠反馈慢慢变准。馆长还给这张隐形图配了抽查。每周挑几道读者问题,让老馆吏人工判断找出的书是否真的相近。若只是词语气味相似、内容用途很远,就把那条路调远。这样,书楼没有迷信新图,而是持续校准它。馆长还提醒馆吏,隐形地图不是神谕。它给出近处候选,最终仍要看读者目的和书中证据是否合拍。

老园丁常说,旧书楼像按门牌找人;新书楼像知道谁和谁住在同一类生活里。字面不同的句子,只要指向同一个需要,就可能在那张隐形地图上相邻。

揭示

这个故事讲的是:密集检索

密集检索(Dense Retrieval)用神经网络 embedding 把查询和文档编码成低维稠密向量,再通过向量相似度寻找语义接近的内容。它能处理同义表达、改写、跨语言和隐含意图,是现代 RAG 的核心检索方式之一。Dense retrieval 通常依赖 embedding model、vector database、ANN index 和相似度度量。它的弱点是对精确编号、罕见词、专有名词和字面约束不一定稳定,因此企业系统常把它与 sparse retrieval、BM25、hybrid search 和 reranker 组合使用。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 只按名字找人:传统关键词或精确匹配检索
  • 看不见的画像:embedding,把文本表示成稠密向量
  • 问题也被画成画像:query embedding
  • 画像越接近越相关:向量相似度,如 cosine similarity 或 dot product
  • 离职后的权限回收找到账号关闭流程:dense retrieval 擅长同义和改写
  • 第 12.4 条被漏掉:稠密检索对精确编号和硬约束可能不稳定
  • 名册一起出手:与 sparse retrieval/BM25 组成 hybrid search
  • 候选重新排序:reranker 提升最终进入上下文的相关性

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

embeddingsvector databasesemantic searchsparse retrievalhybrid searchANN search

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。