← 返回概念解读

Concept Fable精修版

困惑度

Perplexity · Evaluation

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

抄书人猜下一字的难度

松风馆有一群抄书人,专门补旧卷缺字。早年缺口很少,前后句也清楚,老师傅一看上下文,大多能猜出该补哪个字。后来馆里收来外邦诗、药方、账册和船图。缺字越来越多,文体也杂。抄书人常常停住,因为同一个位置可能有好几个合理答案。

馆长的天真修补,是让大家补得更快。谁停顿少,谁就被评为好抄手。结果不少人开始用常见字硬填,卷子读起来顺,却把药方和账册改坏了。

一位校勘师换了办法。他不只看最终补了什么字,还看抄书人在每个缺口前有多犹豫:如果上下文足够清楚,好答案应当很集中;如果可能性分散,说明这卷书难预测。

他给每个抄手一批标准残卷,让他们逐字预测,并记录他们对正确字的把握。不是猜中一处就庆祝,而是看整卷书平均有多难被他们预测。

有个抄手在诗歌上表现很好,在药方上却总是犹豫。另一个抄手能稳定预测账册用语,却不会写漂亮文章。馆长开始明白,低犹豫不等于所有任务都好。

后来有人想用这个分数决定谁能独立修书。校勘师拦住了:它能衡量语言预测是否贴合文本,却不能保证事实正确、工具使用正确、任务完成。

于是松风馆把这项分数放在合适位置:训练语言基本功时看它,比较同类文本时看它;真正交付前,还要人工校勘、事实核查和用途验收。校勘师还发现,一个抄手在熟悉文体上犹豫少,换到陌生卷册就犹豫多。分数因此能暴露文本是否贴近他的训练经验,却不能替他理解药性或历史。校勘师还提醒馆长,犹豫少有时也危险。若抄书人对错误答案特别自信,分数会暴露他没有把正确字放在前面;若整卷文风陌生,犹豫增加也许只是材料超出了他熟悉的范围。

馆长最后明白,知道一句话有多容易被预测很有用,但这只是理解文字流动的一把尺,不是衡量全部智能的秤。

揭示

这个故事讲的是:困惑度

困惑度是语言模型评估指标,用来衡量模型预测一段文本序列的难易程度。困惑度越低,通常表示模型对该文本分布的预测越好。它适合评估语言建模和同类语料上的拟合程度,但不能直接代表 Agent 任务完成率、事实正确性、安全性或工具调用能力。企业评测中,Perplexity 可以作为底层模型观察指标,但必须和业务任务评测、人工评估、轨迹评估及安全评估一起使用。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 残卷缺字:语言模型的 next-token prediction 任务
  • 抄书人的犹豫:模型对下一个 token 的不确定性
  • 标准残卷:用于计算困惑度的评测语料
  • 诗歌和药方差异:不同数据分布上的指标不可简单等同
  • 常见字硬填:低层语言流畅不代表任务正确
  • 人工校勘和用途验收:事实、业务和安全层面的额外评测
  • 最后洞察:Perplexity 衡量预测文本的贴合度,不等于衡量 Agent 的交付质量

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

language modelcross-entropyevaluationnext-token prediction