← 返回概念解读

Concept Fable精修版

语义搜索

Semantic Search · Retrieval method

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

老馆长把关键词抽屉锁进了仓库

城里的公共图书馆有八十年历史。借阅规则从一开始就没变过:想找什么书,先翻索引卡,把书名或作者里的字拼对,再去架子上找。

读者开始变多,问法也变了。有人想知道“什么植物能治咳嗽”,有人找“怎么让小队不吵架”,还有人只记得“一本蓝色封面、讲渔村故事的旧书”。

管理员把卡片按主题重新排,还加了更多关键词。读者仍叹气:咳嗽和止咳配不上,争吵和队伍摩擦配不上,渔村和海边小镇也配不上。

馆长又请人做厚厚的关键词对照表。每种问法旁边写该查哪张卡。表越编越厚,管理员每天查表的时间比查书还多。

一位新图书员没有继续补词。她把每本书的内容、目录和读者备注都做成一串含义坐标,每本书的位置代表它大致在谈什么。读者的问题也放到同一张地图上,找距离近的书。

第一版出来时,有人用“嗓子不舒服的草药”找到了医书里咽痛条目,索引卡上并没有这几个字。馆长这才看见,匹配的是意思,不是字面。

后来馆里把新旧办法叠在一起用。含义坐标负责发现关联,年份、类别和馆藏位置仍由精确条件限定。新图书员也没有丢掉精确线索。读者若知道书名,仍按书名最快;若只说症状、场景和目的,含义地图才派上用场。两种找法服务不同入口。她还给地图设了边界。民间偏方和正式医书可以相近,却不能混成同一种可信度;小说里的渔村和航海手册也许场景相似,用途却不同。找意思时仍要保留类别、来源和使用场景。读者也慢慢学会用自然说法提问。图书馆服务的是人的意图,不再要求人先变成索引卡。馆长说,问法变自由后,馆藏才真正向普通人打开。但她仍提醒大家,相近不等于相同,找到以后还要读正文。

老馆长把最大的关键词对照表送进地下室:检索不该要求提问者先学会馆内黑话。

揭示

这个故事讲的是:语义搜索

语义搜索(Semantic Search)基于意义而非精确关键词匹配来检索结果。它把查询和文档都嵌入到同一个向量空间,通过计算向量距离找到语义最接近的内容。与传统关键词搜索相比,语义搜索能处理同义词、近义表达、跨语言和模糊描述,召回更完整。在企业 RAG 中,语义搜索通常与关键词搜索(BM25 等稀疏检索)组合成混合搜索,弥补纯向量检索在精确术语、数字范围和结构化过滤上的不足。实现时需要选 embedding 模型、确定向量维度和索引、配置相似度度量,并持续监控召回漂移。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 索引卡片:传统关键词/术语检索,必须字面匹配
  • '咳嗽'和'止咳'配不上:关键词匹配无法处理同义词和语义变化
  • 关键词对照表:同义词词典或规则映射,维护成本随表达多样性爆炸
  • SQL LIKE 查询:精确模式匹配,只抓表面字符串而非意图
  • 转成一组数字:将文本 embedding 到向量空间
  • 数字最接近的书:向量相似度计算,基于语义而非字面
  • 新旧两种方法叠在一起:hybrid search,语义检索 + 关键字/过滤的组合
  • 不需要先学会系统语言:语义搜索降低用户的查询准确度要求

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

embeddingsvector databasedense retrievalhybrid searchsimilarity searchANN search

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。