← 返回概念解读

Concept Fable精修版

假设文档嵌入

Hypothetical Document Embeddings, HyDE · Retrieval

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

先写一封可能存在的回信

档案馆的检索员经常接到含糊问题。来人只说‘上次那个延期条款怎么处理’,索引卡上却没有任何文件写着这句话。

早期系统直接拿原问题去找资料。结果它常找到含有‘延期’二字的通知,却漏掉真正相关的交付变更、验收邮件和补充协议。

检索员先尝试加同义词。延期、延后、推迟、顺延都塞进查询里,召回变多了,噪声也变多了。读者要在一堆边缘材料里翻找。

一位老馆员换了办法。他先根据问题写出一封可能的标准回信,里面包含交付日期、合同条款、客户影响和处理建议,再把这封假想回信拿去找相似文档。

神奇的是,假想回信虽然不是真证据,却更像目标答案的语义形状。系统因此找到那些没有使用原始关键词、但确实能支撑回答的材料。

馆长立刻加了红章:假想回信只能当检索钩子,不能当事实来源。最终答案必须回到真实文档、真实记录和可引用证据。馆里后来把命中材料分层:先看相似度,再看来源可信度,最后看能否引用。假想纸条把门推开,真正能站到答复里的,仍必须是真档案。

上线后,HyDE 特别适合短问题、口语问题和术语不一致的知识库。它提升召回,但也需要防止假想内容把检索带偏。后来管事把这次经验写进日常规矩:先看场景,再看边界,最后看失败时谁能接手。只有这些都清楚,漂亮演示才会变成可交付的工作。

档案馆最后留下两层纸:第一层是用来找路的假想文档,第二层才是用来作答的真实证据。老馆员还规定,假想回信要朴素,不许编太多具体事实。它只负责画出问题可能通向的形状,不能把不存在的日期、金额和人名带进检索。

揭示

这个故事讲的是:假设文档嵌入

Hypothetical Document Embeddings, HyDE 是先让模型生成一个假设答案或假设文档,再对这个假设文档做 embedding 并用于检索。它能把短、模糊、口语化问题扩展成更接近目标文档的语义表示,提高召回。风险在于假设文档可能带入错误前提,所以它只能用于检索,不应作为最终证据。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 含糊问题:原始用户 query
  • 假想标准回信:LLM 生成的 hypothetical document
  • 拿假想回信检索:用假设文档 embedding 找相似资料
  • 红章:HyDE 输出不能直接当事实
  • 真实文档作答:最终回答仍需 grounding 和 citations

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

query rewritingdense retrieval