← 返回概念解读

Concept Fable精修版

LLM 评估

LLM Evaluation (Eval) · 评估

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

换了笔墨以后,账房先重算旧账

青瓦商号有个会写信、查账、拟契约的文书。早年掌柜只看他写出来的信是否通顺,客户是否点头。业务少时,这样也能过日子。商号扩大后,文书要处理催款、报价、合同例外、客户投诉和内部审批。看起来像写字,实际每件事都牵着钱、责任和风险。

掌柜的天真修补,是每次换笔墨后随便试三封信。三封都顺,就认为新笔墨更好。直到一次报价信漏掉折扣条件,商号赔了一大笔。

事后复盘发现,文书在普通问候上更漂亮,却在复杂条款、事实引用和边界拒绝上退步。三封样信没有覆盖真正危险的工作。

老账房提出,不要再凭感觉试。先列出商号最常见、最值钱、最容易出错的任务,再为每类任务准备样例、标准答案、评分规则和失败等级。

以后,换笔墨、换纸、换文书习惯、换账本来源,都要跑同一套测试。结果不只看最后文字,还看事实、引用、格式、风险、成本和是否需要人工接手。

有些测试自动判,有些要老师傅看,有些故意设置陷阱。分数下降时,不能靠一句‘整体更自然’放行;分数提高时,也要看是否牺牲了安全和成本。

商号慢慢形成闭环:线上错案进入样例库,样例库进入发布门禁,门禁结果决定是否上线、回滚或继续调整。

最刺痛掌柜的是,赔钱那封信在随手测试里根本没出现。它正是商号最常遇到、也最容易亏钱的场景。掌柜最后明白,会写会答的文书每次变化前后都要重新过关,质量要变成制度,不能只靠一次验收。后来掌柜还学会看分数背后的代价。有一次新文书在大多数题上更快,却在拒绝越权要求时含糊;另一次新笔墨让信更漂亮,却让引用来源变少。老账房坚持把这些放进同一张验收册。商号要的不是一场漂亮试写,而是每次变化都能说明哪些能力进步、哪些风险变大。后来这些错案不再被当成丑事藏起来,而是进入下一轮试题。商号越怕哪类错误,越要把它放到门口反复考。

揭示

这个故事讲的是:LLM 评估

LLM 评估是通过自动化测试、人工评分、模型裁判、对抗探针和线上监控,系统衡量 LLM 或 Agent 在特定任务上的能力、限制、风险和成本。它应覆盖准确性、相关性、事实性、工具调用、格式遵循、安全、延迟、费用和业务结果。企业 eval 的核心价值,是把模型、prompt、RAG、工具和策略变更纳入可比较、可回归、可审计的质量闭环。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 会写信查账的文书:LLM 应用或企业 Agent
  • 换笔墨和换纸:模型、prompt、RAG、工具链或策略变更
  • 随便试三封信:临时 demo 和小样本主观体验
  • 报价信漏折扣:真实业务风险与高代价失败
  • 样例、标准答案和评分规则:eval dataset、rubric 和 scorers
  • 自动判、老师傅看、陷阱题:自动评估、人工评估和对抗评估
  • 错案进入样例库:生产反馈回流到 regression evals
  • 最后洞察:LLM Evaluation 把每次智能系统变更变成可验证的工程决策

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

Benchmark评分指标评估套件 (Eval Suite)A/B 评估

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。