← 返回概念解读

Concept Fable精修版

能力评估

Capability Evaluation · 评估方法

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

匠师会里那场不看口号的入门试

匠师会过去招学徒很简单。孩子背出工具名,能把锤子举稳,就能进门。铺子小,师傅日日盯着,缺什么慢慢教。

后来城里接到宫殿订单,木工、石工、漆工要一起做复杂活。会背工具名的学徒,到了现场却分不清该先量墙还是先切料。

会长先加了更长的问卷。学徒们背得更熟,答得更快,可一到真实工地,仍有人把梁柱顺序搞反。

有人提议看谁做得最快。结果学徒为了快,跳过检查,把小错藏进大工程里。速度好看,返工更贵。

一位老匠师把考试改成几间小屋:识图、选材、协作、处理意外、解释取舍。每间屋都有明确的合格线,也记录失败发生在哪一步。

学徒们第一次发现,自己不是“会”或“不会”,而是在某些能力上稳,在另一些能力上脆。师傅也知道该补哪一课。

宫殿订单开始后,会长只把通过对应小屋的人派到对应工序。没有人再用一张总分解释所有能力。

匠师会后来留下规矩:要相信一个人能接大活,先要知道他在哪些小活上真的可靠。后来,又来了一件更棘手的活。表面看只是旧问题放大,实际把藏在流程里的缝隙都逼了出来:谁先接手、谁能改动、出了错怎样回到上一步,过去靠熟人默契混过去的地方,现在都必须说清楚。主事人没有再催大家更用心,而是把现场重新走了一遍。他让人记录每次交接、每次失败和每次补救,哪些地方只是慢,哪些地方会误伤结果,哪些地方一旦错了就很难追回。新规矩推开后,最初几天并不顺手。有人嫌多了一道检查,有人觉得旧经验被冒犯。可当下一次异常出现时,大家第一次能沿着痕迹找到问题发生的位置,而不是围着结果互相猜。

揭示

这个故事讲的是:能力评估

Capability Evaluation 是对模型或 Agent 的具体能力进行分项、可复现的测试,例如推理、检索、工具使用、长上下文、协作、拒答、安全边界和业务任务完成。它比泛泛跑分更接近企业部署决策,因为企业需要知道系统在哪些能力上可用、在哪些场景必须加人工或控制。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 背工具名:只看知识或通用榜单成绩
  • 宫殿订单:复杂企业任务
  • 几间小屋:分能力、分场景的评测集
  • 明确合格线:可验收的通过标准
  • 记录失败步骤:能力短板定位
  • 按工序派人:按能力边界配置 Agent 职责

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

能力边界任务成功率工具使用评测

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。