← 返回概念解读

Concept Fable精修版

数据连接器

Data Connector · Data ingestion integration

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

水车把各村账本送进同一座磨坊

山谷三座磨坊各自记粮价、库存和赊账,商会却想每天合看。临时派人抄账时,单位、时间和缺失字段总不一致,迟到的一页还会让总账误判。

修桥匠给每座磨坊装取账口:先认证来人,再按约定格式取增量账,保留来源、时间和斤两单位。坏账或断桥时,入口明确返回错误,不把猜测写进总账。

商会又发现有些仓账只准本坊查看。取账口便把权限标签一并带上,只同步新增或变更的记录,并留下谁在何时读取过的痕迹。

一次暴雨冲坏水车,修桥匠从上次成功位置继续,而不是从头抄完三座磨坊。重试、限流和重复记录的处理都写进了规矩。

连接器因此不是一段一次性搬运脚本,而是外部系统进入 AI 检索和工作流时,负责认证、转换、同步与可追溯性的边界。

概念落点

这个故事讲的是:数据连接器

Data Connector 将外部文件、数据库、SaaS 内容、网页或 API 加载到 AI 应用的索引和检索流水线中。它通常处理认证、增量同步、格式转换、元数据、权限标签、错误恢复和数据血缘,是企业 RAG 和知识库问答能持续可靠运行的入口。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

故事对应

  • 各村账本:文件、数据库、SaaS、网页和业务 API
  • 手工搬资料:人工上传或一次性导入
  • 统一账本要求:强迫源系统重构,现实成本高
  • 取水轮:data connector / loader
  • 抽取、转换、过滤:ETL / ingestion pipeline
  • 权限、版本和来源标记:metadata、ACL、provenance
  • 只重取变化部分:incremental sync
  • 最后洞察:Data Connector 决定 AI 系统能否持续拿到新鲜、合规、可追溯的数据

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

loaderingestion pipelineETLLlamaHubconnectorRAG