← 返回概念解读

Concept Fable精修版

多模态 RAG

Multimodal RAG · RAG

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

修桥队为什么不能只读文字档案

老桥队过去修桥,只看工部留下的文字档案。档案写着桥墩尺寸、木梁年份和上次维修时间。桥小水浅时,读档案就够。

后来城里要修一座跨江大桥。文字档案仍在,但现场还有裂缝照片、测绘图、旧匠人的标注、船夫录下的水声和雨季视频。

队长先让书记把所有东西都抄成文字。照片里的细小裂纹被写成“有裂”,图纸上的坡度被写成“略斜”,水声里的异常节奏根本没人会抄。

工程师按这些文字做方案,第一根梁刚吊起,就发现受力方向和图纸不符。文字没有撒谎,只是丢了太多形状、位置和时间。

有人提议只相信照片。可照片看不到历史,图纸看不到潮汐,录音听不出材料老化。每种材料都只握着问题的一部分。

一位测绘师把档案、图纸、照片、视频和录音分别建索引,又让同一个问题能去不同材料里找证据,最后把证据对齐到桥的部位和时间。

当队长问“东侧桥墩为什么下沉”,系统同时拿出旧维修记录、近照裂缝、雨季视频和水流测量。答案终于有了形状。

修桥队后来明白,大桥不是只活在文字里。要让资料帮忙,必须让不同模态的证据能一起被找到、对齐和引用。后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。新规矩推开后,最初几天并不顺手。有人嫌多了一道检查,有人觉得旧经验被冒犯。可当下一次异常出现时,大家第一次能沿着痕迹找到问题发生的位置,而不是围着结果互相猜。

揭示

这个故事讲的是:多模态 RAG

Multimodal RAG 是把文本、图片、表格、图纸、音频、视频等多种模态纳入检索增强生成,让模型回答时能引用不同类型证据。企业场景中,大量知识存在于扫描件、产品图、工单截图、合同表格、录音和视频里。难点在于解析、嵌入、跨模态对齐、证据定位和输出可核验。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 文字档案:传统文本 RAG 资料
  • 照片、图纸、视频、录音:多模态企业知识
  • 全部抄成文字:强行文本化导致信息损失
  • 只相信照片:单模态偏见
  • 按桥部位和时间对齐:跨模态索引和 grounding
  • 同时拿出多种证据:多模态检索增强回答

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

VLMembeddingsdocument AI

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。