← 返回概念解读

Concept Fable精修版

Haystack

Haystack · NLP and RAG framework

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

问答坊把寻书、筛书和答书排成流水线

北城问答坊专替商户回答制度、产品和合同问题。最早只有一个老伙计,凭记忆翻资料,边找边答。商户越来越多后,老伙计开始漏看新文件。相似问题答法不一致,引用也常常指向过期版本。坊主先买了更大的书柜,把所有文档都塞进去。搜索快了一点,但有些问题需要关键词,有些需要语义,有些还要重排证据。他又让每位伙计自己挑工具:有人用旧索引,有人用相似柜,有人直接问机关。结果管线难查,错误也难复现。

新坊主把工作拆成流水线:文档进入存储,检索器找候选,重排器筛证据,阅读器或生成器组织答案。

不同客户可以换不同组件。客服知识库偏向问答,法务资料强调引用,产品搜索需要混合检索和过滤。

流水线让问题暴露得更清楚。是文档没进库,还是检索没命中,还是生成器胡编,终于能逐段定位。

坊主仍要管理索引刷新、权限隔离、评测集和延迟预算。组件齐全不等于业务答案天然可靠。

他明白,问答整套装置不是一次机关调用,而是一条可组合、可观测、可替换的知识处理流水线。

新坊主又设了验答案的小桌。每次伙计答完,必须把引用放回原文旁边核对;若证据太旧、权限不该看、或答案越过材料,整条流水线都要退回调整。

几个月后,问答坊接了大客户。客户不要一个会说话的伙计,而要一套能换柜、能换尺、能查错、能证明出处的流程。坊主这才知道,真正值钱的是把找资料、筛证据和组织回答变成可治理的作业。当客户要求换一套书柜或换一位答复员时,流水线仍能接住,不必推倒整间问答坊。这让每次改造都能从出问题的一段下手。

揭示

这个故事讲的是:Haystack

Haystack 是开源的搜索、问答、RAG 和 LLM pipeline 框架,常用于在企业文档和知识库上构建检索增强应用。它提供 Document Store、Retriever、Ranker、Reader、Generator、Pipeline 等组件,方便把文档存储、搜索、重排和生成组织成可调试的系统。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 老伙计凭记忆:人工或单点脚本式问答
  • 更大的书柜:只扩存储而缺少完整管线
  • 各自挑工具:不可维护的分散实现
  • 流水线:Haystack Pipeline
  • 文档存储、检索器、重排器、生成器:Document Store、Retriever、Ranker、Generator
  • 换不同组件:Haystack 的模块化架构
  • 逐段定位:可调试的 RAG / QA pipeline
  • 最后洞察:Haystack 用组件化流水线构建企业搜索、问答和 RAG 应用

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

pipelinedocument storeretrieverreadergeneratorRAG