← 返回概念解读

Concept Fable精修版

评测框架

Evaluation Harness · Quality assurance

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

赛马不是只看一次冲刺

王国每年选信使。过去考官随口出题:今天跑山路,明天背口令,后天送密函。谁看起来机灵,谁就被选中。

几年后,边境出了麻烦。被选中的信使在晴天跑得快,遇到夜雨却迷路;有人会背口令,却把急信送错门。考官们争论不休,因为每年题目都不同,没人说得清谁真的可靠。

国王先要求考官出更多题。题多了,场面更热闹,却更难比较。一个信使抽到平路,一个抽到雪山,分数摆在一起并不公平。

老驿长提出搭一座固定试场。里面有相同的山路、夜路、错门牌、假催促和时间限制。每位信使按同一套流程走一遍,出错在哪里、耗时多少、是否能求助,都记录清楚。

第一次试场运行后,许多“看起来聪明”的人露了底,也有慢信使在复杂路况中稳定胜出。考官终于能讨论具体能力,而不是争谁印象更好。

试场并没有替国王决定一切。若要送海岛信,还得新增水路关卡;若边境规则变了,旧题也要更新。它的价值,是把挑选从随意表演变成可重复、可比较、可复查的检验。

试场里还放了几道诱题:假急信会催人越过规矩,错门牌会诱人投机取巧,夜路会考验是否求助。它不是为了难倒信使,而是覆盖真正上路后最常见的失败。驿长还把评分拆开。速度、准确、求助、守密和遇阻处理分别记录。一个人跑得快却泄露口令,不能被总分遮住;一个人慢些但每次能把险情报清,也可能适合更复杂的路。固定试场让能力画像变得可讨论。国王也因此能比较训练法。新训练若在同一试场上没有改善,只是看起来热闹,就不会被推广。驿长说,真正的考试要像未来的路,而不是像考官当天的心情。

后来,每次更换信使训练法,驿站都先跑一遍试场。大家不再问“这人像不像能干”,而是看他在同一批关键场景里是否真的完成任务。

揭示

这个故事讲的是:评测框架

评测框架 Evaluation Harness 是一套可重复运行的测试环境和用例集合,用来评估模型或 Agent 在不同任务、边界条件、工具调用、延迟、质量和失败场景下的表现。它让团队能在变更前后对比质量,而不是靠一次演示或主观感觉判断系统是否变好。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 新马:新的模型、Agent、提示词或工具链
  • 一次冲刺:单次 demo 或少量样例,看起来效果很好但不代表稳定
  • 泥地、石路、窄桥、鼓声:多样化测试用例、边界条件和压力场景
  • 记录时间、失误、恢复情况:评测指标,包括准确率、延迟、失败率、恢复能力等
  • 几轮训练后再跑同一套场地:变更前后用同一评测集回归测试
  • 可以送普通信但不送山路重包:根据评测结果定义适用范围和限制
  • 可重复的场地:Evaluation Harness 的核心价值是稳定、可复现、可比较

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

guardrailsregression testingagent evalsworkflowsreliability