← 返回概念解读

Concept Fable精修版

幻觉检测

Hallucination Detection · 可观测性

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

验票员不看嗓门,只看票根

码头有位报站员,能把船只、货物和天气讲得头头是道。乘客听他说话清楚,就以为所有消息都可靠。

一次他报错了船期。声音依旧洪亮,格式也没乱,但票根上的出航时间完全不同。乘客赶到码头时,船已经走了。

码头先让报站员放慢语速,增加复述。错误少了一些,却仍有关键事实和票根不一致。

新来的验票员提出另一套检查:把报站员的每个关键主张抽出来,逐条对照票根、港务记录、天气台和合同。

检查结果被分成几类:证据支持、证据反驳、证据缺失、表述过度。这样团队终于能看见错误类型,而不是只说‘那套机器不靠谱’。

验票员还接入生产链路。高风险答案发布前先做自动比对,发现不一致就要求改写、补证据或转人工。

他们也承认检测会漏报和误报。证据库不全、主张抽取不准、同义表达复杂,都会影响判断。因此检测结果要进入评测和人工抽检。

码头最后把清晰嗓门和事实可靠分开管理。听起来像真的,不再等于可以放行。后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。新规矩推开后,最初几天并不顺手。有人嫌多了一道检查,有人觉得旧经验被冒犯。可当下一次异常出现时,大家第一次能沿着痕迹找到问题发生的位置,而不是围着结果互相猜。

揭示

这个故事讲的是:幻觉检测

Hallucination Detection 是检测模型输出是否与给定上下文、来源文档或已知事实不一致的机制。常见做法包括主张抽取、证据匹配、NLI/LLM judge、引用覆盖检查和人工抽检。它适合放在 RAG、客服、知识问答、合规说明等高风险链路中,但需要评估误报、漏报和证据库质量。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 报站员:生成模型输出
  • 票根和港务记录:可验证证据来源
  • 逐条对照关键主张:claim-level hallucination detection
  • 支持/反驳/缺失/过度:错误分类
  • 发布前自动比对:生产链路中的检测门禁

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

事实一致性忠实度评估SelfCheckGPTRAG 忠实度