← 返回概念解读

Concept Fable精修版

评测基准

Benchmark · Evaluation

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

选信使不能只看谁跑得快

白塔镇早年只有一条街。镇长选信使很简单,让候选人从南门跑到北门,谁先到,谁就负责送信。那时信少,路直,这个办法够用。

后来镇子扩到山坡和河港。信有急信、账单、密函和药方;路有石阶、泥滩、窄桥和夜路。南北门冲刺再也不能代表全部能力。

镇长的天真修补,是把跑道加长。候选人确实更累了,可仍然看不出谁能在雨夜找到药铺,谁能在密函丢失时及时上报。

更糟的是,有人专门练那条长跑道。他们知道哪里有坑、哪里能抄近路,成绩越来越漂亮,真正送信时却常常迷路。

老邮差建议先写清楚镇子真正需要什么:准时、准确、保密、能处理意外、能解释失败。然后为每一类能力设计固定场景。

新的试场包括雨路、错门牌、重复地址、临时封桥、收信人不在、密信封蜡破损。每个候选人都按同一套场景跑,记录用时、错误、补救和交付结果。

有些人长跑第一,却在错门牌前直接放弃;有些人速度一般,但会核验地址并留下记录。镇长终于能比较不同信使适合哪类任务。

试场也不是一成不变。镇里新增码头后,评测里加入潮汐和船期;诈骗信变多后,又加入身份核验。白塔镇从此不再用一次表演决定信任。它用一组可重复、可比较、贴近真实工作的任务,判断谁能承担哪种责任。后来镇里又来了骑马信使和渡船信使。若只跑南北门,他们都能赢过步行者;可遇到山坡小巷、封桥和收信人不在,优势立刻变样。镇长于是把成绩分开放:速度、准确、补救、保密、成本各记一栏。信使不再争一个总冠军,而是看自己能稳定承担哪类真实差事。镇长还规定,候选人不能提前知道全部路线,只能知道评判规则。这样比的不是背赛道,而是在相同压力下完成真正差事。后来所有新路线都先进入试场。试场因此越来越像真实镇子。

揭示

这个故事讲的是:评测基准

评测基准是用于比较模型、Agent 或系统能力的一组标准化任务、数据集、指标或测试套件。好的 benchmark 不只是排行榜题目,而要对应真实业务场景、失败边界和验收标准。企业 Agent 的基准应覆盖任务完成率、步骤质量、工具调用、延迟、成本、安全红线和可解释失败,帮助团队在模型、提示词、RAG 和工具链变化后做稳定比较。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 信使:模型、Agent 或不同系统方案
  • 南北门冲刺:单一 demo 或过窄测试集
  • 雨路、错门牌、封桥:标准化、多样化的评测用例
  • 用时、错误、补救和结果:评测指标与错误分类
  • 专门练跑道:只针对基准优化而不提升真实能力
  • 新增码头后更新试场:benchmark 需要随业务和风险变化维护
  • 最后洞察:Benchmark 是可重复比较能力的尺,不是替代真实业务判断的奖牌

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

evaluationleaderboardtest setMMLUHumanEval