← 返回概念解读

Concept Fable精修版

双编码器

Bi-Encoder · Retrieval

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

两座仓库先各自做了编号

档案馆最早靠人找资料。读者提问后,管理员一排一排翻书,遇到相似内容就夹一张纸条。书少时还行,资料一多,队伍排到了门外。馆长让每本书先写摘要。读者的问题也写成摘要,再比较摘要是否相近。速度好了一点,但摘要长短不一,比较起来仍然费劲。有人提议每次都让老师傅把问题和每本书放在一起细看。结果准确了,却没人等得起。库房有百万页,老师傅一天只能看几百页。年轻管理员换了思路。他让所有书在夜里先各自量一次,变成固定长度的号码;读者的问题来了,也先量成一个号码。号码相近的书先被找出来。

起初大家担心:问题和书没有放在一起细看,怎么知道它们真相关?管理员说,这一步只负责把大海缩成池塘,不能负责最后裁判。

一个售后 帮手 要查‘更换主板后许可证失效’。号码整套装置很快从千万条知识中拉出几十条相近案例,其中有些写的是授权重绑,有些写的是硬件指纹变化。

随后,馆长再让审卷官细看这几十条。先快召回,再精判断,整条链路终于既能覆盖大库,又不会把机关上下文塞满。

后来,档案馆把书的号码提前存进索引,还给不同业务线准备不同测量尺。通用尺能找大概,领域尺能找细节。

大家明白了:第一步不是把每份材料都审到完美,而是用可预计算的表示,把候选范围压到整套装置能承受的大小。

这种办法也会犯错。号码相近不代表一定相干,有些词面不同的书会被拉近,有些意思相近的旧卷会被漏掉。所以馆长从不让号码系统单独作最后决定。

真正的好处出现在高峰日。读者排队时,馆员先用号码把百万页压成一小摞,再请审卷官精读。速度来自提前量好的号码,可靠来自后面仍有人细看。

揭示

这个故事讲的是:双编码器

Bi-Encoder 是分别编码查询和文档,将两者转换成向量后用相似度进行匹配的架构。因为文档向量可以离线预计算并存入向量数据库,它非常适合大规模语义检索、RAG 第一阶段召回、相似案例搜索和推荐。它的弱点是查询和文档没有联合交互,细粒度条件匹配通常不如 Cross-Encoder,因此企业系统常用 Bi-Encoder 召回,再用 Cross-Encoder 或 reranker 精排。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 夜里给书编号:离线计算文档 embedding
  • 读者问题也编号:在线计算 query embedding
  • 号码相近先找出:向量相似度检索
  • 大海缩成池塘:第一阶段高效召回
  • 老师傅同桌细看:cross-encoder 精排
  • 售后 Agent 案例:企业知识库中按语义找相似问题
  • 不同测量尺:不同 embedding 模型或领域微调模型

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

embeddingsdense retrieval

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。