← 返回概念解读

Concept Fable精修版

评估套件

Eval Suite / Eval Harness · 工具

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

二十四道门的试工场

城北有一座试工场,所有新来的匠人都要从那里经过。最早的时候,掌柜只让他们修一把椅子,谁修得快、看着顺眼,谁就能进铺子接活。

铺子后来接了官府、药铺、船队和学堂的订单。椅子修得好的人,不一定会补账本;会补账本的人,遇到潮湿木料又会判断错。旧办法开始把能演示的人当成能交付的人。

掌柜先把试题加长,要求每个人一次做完十件事。看起来更严格了,但匠人们很快学会先做最显眼的活,把难查的缺口藏在背面。验收时一片热闹,交出去后返工更多。

有人又建议请最有经验的师傅站在门口打分。师傅眼力很好,可每天心情、疲劳和关注点都不一样。两批匠人做出同样的东西,分数却差得很远。

后来账房把试工场改成二十四道门:有快活、慢活、坏料、催单、缺工具、误报消息和夜间巡检。每道门都有固定记录,做错在哪里、用了多久、是否求助,都写在红墨册里。

新匠人不再靠一件样品定生死。旧匠人换了工具,也要重新过同一批门。掌柜第一次能看见:有的人速度快但容易漏安全钉,有的人慢却稳定,有的新锯子只在干木头上好用。

最重要的变化发生在发布前。只要红墨册里有关键门没过,铺子就不接对应订单。没有人再用“我觉得这次可以”压过记录。

几年后,城里人说那座试工场耽误了不少热闹,却救下了更多交付。它没有让匠人都变成天才,只是让每一次改动都必须面对同一套真实问题。后来掌柜又发现,二十四道门本身也要维护。城里出现新材料,试场就加入新关卡;旧订单不再重要,对应关卡就降低权重。否则匠人会把力气花在过时题目上,试工场也会骗人。账房每月检查红墨册,确认它仍贴近铺子真实要交的活。后来新掌柜上任,想凭一次面试省掉试工场。账房把返工账本递给他:没有同一批门,谁也说不清变好还是变坏。

揭示

这个故事讲的是:评估套件

Eval Suite / Eval Harness 是把测试数据、任务场景、执行流程、评分规则和报告汇总在一起的评估系统。它用于批量、可重复地检查模型或 Agent 在质量、工具调用、安全、延迟、成本和回归风险上的表现。企业落地时,它把“看起来能用”的演示变成可比较、可复查、可验收的证据。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 试工场:企业 AI / Agent 的统一评估环境
  • 二十四道门:覆盖不同任务、边界条件和失败场景的评测用例
  • 旧木牌:只靠单次演示或人工印象判断效果
  • 红墨记录:可追溯的评分、日志和回归报告
  • 锁住的门:发布门禁,未通过评测不得上线
  • 轮换师傅:不同模型、提示词和工具链版本之间的可比测试

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

lm-evaluation-harnessOpenAI EvalsLangSmith