← 返回概念解读

Concept Fable精修版

多模态

Multimodality · Multimodality

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

只听文字的柜台开始漏掉真相

保险理赔大厅最早只收表格。客户把事故经过写下来,理赔员按文字判断责任、损失和下一步材料。

后来客户开始上传照片、行车记录仪片段、维修录音和聊天截图。表格仍然重要,但真相常藏在图片角落或视频前几秒。大厅的旧系统只会读文字。工作人员只好让客户把照片里的内容描述一遍,把视频里的情况写成说明。客户写不清,理赔员也看不全。

主管先加了一条规定:所有非文字材料必须人工转写。队伍立刻变长,转写还常遗漏关键细节,比如裂痕位置、灯号颜色和说话语气。

新系统没有把所有东西都压成文字。它把文字、图片、视频、音频和结构化字段都当作案件的一部分,让 帮手 在同一个流程里读取和比较。

一次争议案中,客户文字说‘设备正常关闭’,视频却显示红灯闪烁,维修录音里工程师提到上次补丁未完成。三种信号合在一起,判断才完整。

理赔员发现,多模态不是多几个上传入口,而是让不同形式的证据共同参与推理、检索和决策。系统也设置了边界:视觉识别低置信度时要请求人工复核;音频转写涉及隐私时要脱敏;结构化字段和原始证据必须一致可追。

理赔主管先加派人手,把影像内容全部转写成文字。队伍更长了,细节仍在转写时丢失:裂痕方向、雨夜反光、刹车声的迟疑,纸上写不出。后来大厅换了新柜台。柜台能同时看表格、照片、片段和录音,但每种材料都标明来源,重要判断还要让理赔员复核。

一桩小撞车案改变了大家的看法。文字说“轻微剐蹭”,照片角落却露出断裂的儿童座椅卡扣。只听一种材料,真相就会缺一边。大厅最后换掉了那句老口号:只要表格填得完整就够了。真实业务从来不是单一格式。

揭示

这个故事讲的是:多模态

Multimodality 指 AI 系统能够处理、结合或生成多种模态的数据,包括文本、图像、音频、视频和结构化信号。企业 Agent 落地中,多模态能力让系统能理解截图、合同扫描件、客户语音、操作视频、表格和日志,而不只依赖用户文字描述。难点在于证据融合、置信度控制、隐私处理、模型成本和人审边界。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 只收表格:单文本系统
  • 照片、视频和录音:企业流程中的多模态证据
  • 人工转写:把多模态压成文本导致信息损失和成本上升
  • 新系统共同读取:多模态模型或多模态 Agent 流程
  • 红灯、录音和补丁记录:不同模态互相补充
  • 低置信度复核:多模态落地需要置信度与人工边界
  • 真实业务不是单一格式:多模态的商业必要性

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

vision-language modelimage generationspeech modelcross-modal embedding