← 返回概念辨析

Concept Contrast Fable

评测和评测基准

评测是你对自己系统的一次质量检查,题目、流程、打分标准都由你定。评测基准是一套公开的标准试卷,所有人都用同一套题来比分数。把自定义评测当成行业通行证,会高估自己的真实水平。

寓言

自家体检和行业统考

武馆要判断弟子功夫。师傅每天设小考:今日测闪避,明日测耐力,后日测夜路反应。小考随训练变化,哪里弱就补哪里。

城里另有一年一度擂台赛,规矩固定,所有武馆都来参加。擂台榜能比较谁强,却不会为某个弟子的短处临时改题。

新馆主把两者混在一起。他拿日常小考成绩去对外吹嘘,又拿擂台榜指导每一天训练。结果弟子为了擂台固定招式苦练,真正任务里的弱点没人看见。

老馆主提醒:小考是为改进服务,可以按目标设计、反复调整;擂台是共同尺子,方便横向比较,必须稳定公开。

新馆主后来把两本册子分开。训练册可以常改,专抓自家短板;擂台册不能随意换,换了就失去横比。弟子每天练什么,看训练册;对外说自己在城中排第几,看擂台榜。

有一回武馆擂台名次升了,师傅仍加练夜路反应。旁人不解,他说擂台赢了只说明共同招式不错,自家押镖任务里的风险还得自己测。

后来有弟子专门练擂台招式,日常押镖却被山路绊倒。师傅把他拉回小考:今天测夜路,明天测雨中护货。共同尺子能赢名次,自家体检才能发现自己会在哪里摔。 后来武馆招生时,既亮擂台名次,也展示日常小考如何发现短板。一个给外人比较,一个帮自己改进。两本册子各有用处,混用才会误导训练。 从此,武馆既不拿体检当奖杯,也不拿统考替代训练。训练才准。弟子也少走偏路。更稳。训练更有方向。

后来武馆分开两本册。内册记录各种针对性试炼,用来找问题;外榜记录统一擂台成绩,用来看位置。一个帮你变好,一个帮别人看懂你在哪。

评测 (Evaluation/Evals)

团队自己设计题目、标准、流程进行的系统质量评估。灵活、可定制、高频,用来指导内部迭代。和外部没有可比性。

评测基准 (Benchmark)

公开、标准化、可复现的测试集和评分协议,供不同系统横向比较。牺牲了定制性,换取了可比性和公信力。

故事对应

  • 馆内测评:Evaluation,自定义标准,自己打分,用于内部改进。
  • 区比武:Benchmark,统一标准,第三方裁判,用于横向比较。
  • 测评标准偏软:自定义评测的评分标准如果与真实业务需求不对齐,分数再高也没用。
  • 训练检查 + 对抗摸底:内部分层的评测评体系——一部分跟踪进步,一部分模拟实战。

落到项目里

内部评测和公开 Benchmark 都要做,但用途不同。内部评测每周跑一次,监控迭代有没有退步,题目要覆盖自己的典型业务场景。公开 Benchmark 每季度跑一次,用来对外说明水平和跟踪行业进展。最忌讳的是只跑自己的评测、分数好看、一上客户真实场景就崩。自己出的卷子只能证明你练过这道题,不能证明你会做别的题。