← 返回概念辨析

Concept Contrast Fable

一套题和一场考试

供应商说「我们在某某 benchmark 上表现很好」,这句话到底在说什么?当有人说「我们做了 evaluation」,又在做什么?这两个词听起来很像,核心区别却关系到钱花得值不值。

寓言

武馆的两种考法

临江城有三十家武馆,每家都说自家弟子身手最好。城主不想听掌门吵,便设了一场统一比试:同一根木桩、同一段梅花桩、同一套护具,所有弟子按相同规则计分。

这场比试很快分出高下。甲馆腿法快,乙馆耐力好,丙馆一遇夜战题就乱。因为题目相同,分数可以摆在一起比,外地人也能看懂哪家在这套考法下更强。城主榜也有用。外地学徒择馆、掌门改课,都需要这把公开尺子;它的问题只在于有人把公开尺子当成所有真实任务的答案。

可统一比试之后,镖局仍不满意。镖局护送的是夜路商队,最怕雨天泥地、窄桥和突发埋伏。统一比试里没有这些,分数第一的弟子上了真路,反而不如分数第三的人稳。镖局第一次也偷懒,直接雇了榜首弟子。雨夜过窄桥时,榜首动作漂亮,却不会护货、看路和照顾受伤同伴。

镖局掌柜于是自己设考:雨夜走桥、护住货箱、遇假乞丐探路、同伴受伤后改道。题目不求全城可比,只看这趟镖能不能安全送到。掌柜还会根据货物、路线和季节不断改考法。掌柜设考后,还会保留失败记录。若弟子在雨夜总乱,下一季训练就加夜路;若货箱常被丢,考法也跟着改。

有掌门抱怨:“你这分数不能和城主榜相提并论。”掌柜答:“我本来也不是给全城排座次,我是在决定谁能接我的活。”

城主后来也采纳镖局经验,给公开比试加了少量雨夜题。但他没有把榜单改成镖局任务书。公开尺子要稳定,场景考核要贴近交付,两者仍各有位置。

后来武馆弟子先看城主榜,知道自己在公开尺子下的位置;接镖前再过镖局考,确认能不能完成特定任务。两种考法都重要:一套让许多人可比较,一套让某个场景可负责。混在一起,既会误判排名,也会误判交付。

评测基准

在固定任务上用统一标准比较不同模型的性能表现,分数可以直接对比

evaluation (evals)

根据具体业务目标设计任务,评估模型在实际场景中的真实效果

故事对应

  • 三场统一比试 → benchmark 的标准化测试
  • 马步、木人、兵器 → benchmark 的具体题目
  • 分数排名 → 不同模型的可比指标
  • 派徒弟真办事 → 真实业务场景的 evaluation
  • 假县城模拟 → 贴近实战的评估任务
  • 徒弟自己出题自己考 → evaluation 的自定义任务设计
  • 师父主观评价 → evaluation 中的人类评估或业务指标

落到项目里

如果有人告诉你「我们在这个 benchmark 上领先」,先问自己:这个 benchmark 考的是不是我关心的那件事。刷榜常用的题目可能跟你的业务场景毫无关系,这时候 benchmark 分数再高也不值得花钱。相反,如果你的场景确实有公认的标准测试,拿来比较模型是合理的做法。但最终判断模型能不能用,一定要做自己的 evaluation——用你真实的数据、真实的任务、真实的评价标准,跑一遍看看效果。