← 返回概念解读

Concept Fable精修版

逐轮评估

Per-Turn Evaluation · 评估方法

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

每一步棋旁边的小记分牌

棋院评学徒,过去只看最后输赢。老棋手觉得公平,棋盘收起时谁赢谁就好,过程不用多问。

后来棋局变长,问题暴露。有人前十步布得很好,中盘乱送;有人最后赢了,只是对手走错。单看终局,老师分不清能力和运气。

院长先让大家多下几盘。样本多了些,仍看不出哪一步误解局势,哪一步只是被对手逼住。学徒也不知道该改哪里。

他又要求赛后自评。学徒往往把侥幸说成妙手,把关键错误轻描淡写;复盘越写越漂亮,训练却没有变准。

一位教练在棋盘旁放小记分牌。每落一子,都记当时目标、可选动作、判断理由、局面变化和是否接近计划。

评审不再只看终局,而能看到第三步是否误读局势,第七步是否选错手段,第十二步是否忽略威胁。有些胜局被评低,因为靠侥幸;有些败局保留高分,因为每一步在当时信息下合理。棋院终于能训练具体能力,而不是只奖励结局。

后来棋院把小记分牌用于训练,而不是只用于处罚。某个学徒总在开局误判目标,就练开局;另一个总在中盘选错交换,就专练中盘。

终局分数仍保留,因为棋要赢才算完成。但每步记录让老师知道胜负怎样发生。棋院不再把一盘棋压成一个数字,而是把长过程拆成能改进的许多小判断。 后来新手入门时,老师傅不再先讲抽象名目,而是让他们复盘那次失误:原先哪里靠直觉,第一次修补为什么不够,新的安排怎样把风险留在能检查的位置。等他们能说清这些细节,还能指出什么时候该沿用、什么时候该升级,才算真正懂了这套办法。 后来他们还把这套办法交给新人演练:先让新人按旧办法做一遍,看错误怎样出现;再按新规矩重做,看哪一步被提前拦住,哪一步留下了证据。新人若只会背名字,仍会在相似场景里乱用;只有能说出适用边界、代价和失败后的补救,才被允许独立接活。

揭示

这个故事讲的是:逐轮评估

Per-Turn Evaluation 是对 Agent 或对话系统在每一轮行动、工具调用、观察和回复中进行评估,而不仅看最终结果。它适合长链任务、客服、代码修复和多工具工作流,可定位具体失败步骤,衡量指令遵循、工具选择、状态更新、安全性和进展质量。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 整盘输赢:最终任务成功率
  • 每步小记分牌:逐轮评估
  • 目标、理由、局面变化:turn-level traces
  • 侥幸胜局:结果指标掩盖过程问题
  • 错误工具选择:中间步骤失败
  • 训练具体能力:基于细粒度反馈改进。

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

对话质量评估轮次级别评分上下文依赖

相关辨析

这个概念容易和相邻概念混用,建议继续看对比页。