← 返回概念解读

Concept Fable精修版

检索精确率

Retrieval Precision · RAG evaluation

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

十支箭里到底有几支射中了靶心

售后城门口挂着一个新告示:知识库检索已经上线。每次客户提问,整套装置会找回十段资料,再交给答复员写回信。第一周,大家很兴奋。整套装置几乎总能找出一些看起来相关的段落。主管看着满桌材料说,既然每次都有结果,检索应该不错。可客户投诉没有下降。答复员说,材料是有,但常常只有两三段真正能用,其余只是共享了产品名、版本号或常见措辞。工匠先把返回数量从十段降到五段。桌面清爽了,关键证据却有时被删掉。再升到二十段,证据多了,噪音也跟着回来。

于是他们开始做一张验靶表。对每个问题,人工标出哪些段落真正回答了问题,再计算整套装置拿回来的结果里,有多少比例是命中的。

一次许可证问题中,整套装置返回十段,只有四段真正相关。过去大家只说‘找到了很多’,现在只能承认:十支箭里只有四支射中靶心。

这个数字改变了讨论。团队不再争论感觉,而是看不同 坐标法、chunk 大小、reranking 策略下,命中比例如何变化。

主管也发现,高精确率并不等于万事大吉。如果只拿回两段且都相关,比例很高,但可能漏掉关键政策。精确率必须和召回率一起看。

从此,检索整套装置的验收不再是页面上有没有结果,而是返回给机关的上下文有多少是真正该看的证据。

验靶表还让答复员少了很多争吵。过去他说材料不能用,工匠说已经找到了;现在他们把每段贴到靶上,命中就是命中,擦边就是擦边。

几轮调整后,主管开始同时看两件事:拿回来的纸有多少真能用,以及真正该看的纸有没有漏掉。城门口的告示也改了,不再夸“能找到”,而是承诺“找回来的证据经得起核对”。

揭示

这个故事讲的是:检索精确率

Retrieval Precision 衡量检索返回结果中真正相关结果所占比例。在 RAG 中,它回答的问题是:进入模型上下文的 chunk 里,有多少确实能支撑当前问题。高 precision 能减少噪音上下文、降低幻觉和无关引用,但如果过度追求 precision,也可能牺牲 recall。企业落地时通常用标注集评估不同 chunking、embedding、hybrid search 和 reranking 配置下的 precision@k。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 十段资料:top-k 检索结果
  • 真正能用的两三段:相关文档或相关 chunk
  • 验靶表:人工标注或黄金数据集
  • 十支箭里四支命中:precision@10 的直观含义
  • chunk 大小和 reranking 策略:影响检索精确率的工程变量
  • 只拿两段且都相关:高 precision 可能伴随低 recall
  • 返回给模型的上下文:RAG 中 precision 的直接业务影响

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

recallrerankingrelevance

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。