← 返回概念解读

Concept Fable精修版

语义相似度

Semantic Similarity · Embeddings

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

不同信封里的同一件事

书楼要把意思相近的来信放到一起。学徒最初按字面归类,凡有‘船’字的放一柜,有‘马’字的放一柜。

很快出错。‘船期延误’和‘货到晚了’没有同字,却讲同一件事;‘马车坏了’和‘马上付款’都有马字,意思相距很远。

老馆员让学徒先问信在表达什么:请求延期、投诉损坏、询问价格、确认地址。字可以不同,意图相近;字可以相同,意图相远。

他们开始给每封信做意向标记,再按距离摆放。相近的信放邻柜,稍远的放隔柜,完全无关的分楼层。查旧例时,馆员不再只找同字,也找同意。

第一次按意向摆放后,学徒仍犯错。他把‘要求延期付款’和‘询问延期规则’放得太近,老馆员让他补看来信目的:一个在请求宽限,一个只想了解制度。相近不等于相同。

书楼后来允许一封信靠近多个柜子。‘货到晚了’既靠近物流投诉,也靠近赔付咨询;查信的人先看邻近,再看差别。字面不再牵着所有判断走。

老馆员还提醒学徒,距离会随任务变化。为投诉处理找旧信时,‘货到晚了’和‘船期延误’很近;为运输工具统计时,船和马又要分开。相似不是纸面上的永恒亲戚,要看此刻想解决什么事。 后来学徒查信时,先问这次要找同义问题、同类意图,还是同种物件。问题一变,信与信之间的远近也变。书楼终于不再被相同字眼牵着鼻子走。 后来书楼的旧例查得更准,误放在一起的信也少了。查找更稳。旧例也更好用。

书楼因此能发现许多表面不同的重复问题。相似不等于长得像,真正有用的相似,是在意思、用途和上下文上靠得近。

揭示

这个故事讲的是:语义相似度

Semantic Similarity 衡量两段文本、问题、任务或对象在意义上的接近程度,通常通过 embedding 向量距离或相似度计算实现。它是语义搜索、去重、聚类、推荐、RAG 检索和工单路由的基础。企业使用时要注意,相似不等于相同,高相似请求仍可能在权限、时效、意图和业务后果上有关键差异。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 不同信封:表面措辞不同的文本或请求
  • 信的主旨:语义表示
  • 按字数分拣:关键词或字符串匹配的局限
  • 放在同一格:高语义相似度
  • 误把急信当闲信:相似度忽略业务差异的风险
  • 复核印章:阈值、规则和人工审核

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

cosine similarityembeddingsretrievalclustering