← 返回概念解读

Concept Fable精修版

可验证奖励强化学习

Reinforcement Learning with Verifiable Rewards, RLVR · Training

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

会自己落锁的答案箱

河东有家锁铺,学徒出师前要配钥匙。过去老师傅看一眼钥匙形状,觉得顺眼就点头;学徒也渐渐学会把钥匙磨得漂亮。

漂亮钥匙拿到客人门前,却常打不开。老师傅解释说,自己看的是手艺气象,不是每把锁的真实咬合。客人不听这套,只问门能不能开。

掌柜先请更多师傅一起看。有人喜欢圆滑,有人喜欢锋利,有人被学徒的解释打动。评语变多了,门还是有时打不开。

后来铺子做了一排答案箱。每把钥匙配好后,必须插进对应箱子;能转到底,铜锁自己落下;转不到,箱子不讲情面。

学徒一开始很狼狈。讲得漂亮的钥匙没有用,只有真正咬合的齿纹会得到清脆一声。失败也变得有价值,因为每次卡住的位置都能被记下。

锁铺开始围绕可验证的结果练习:账本算式要对,机关图要合,门锁要开。师傅仍教手感,但最后奖励来自箱子。掌柜说,有些活需要审美;急救库房、军械仓和账房柜,必须先让锁自己承认。

学徒后来也学会挑题。能放进答案箱的活,适合靠箱子反复练;无法自动判断的礼仪钥匙,则要请师傅评审,不能假装铜锁会懂审美。

锁铺把两类训练分开后,进步更快。凡是能明确验成败的地方,就让结果直接说话;凡是结果含混的地方,就保留人的判断。掌声可以鼓励人,落锁声才能证明门真的开了。 后来新手入门时,老师傅不再先讲抽象名目,而是让他们复盘那次失误:原先哪里靠直觉,第一次修补为什么不够,新的安排怎样把风险留在能检查的位置。等他们能说清这些细节,还能指出什么时候该沿用、什么时候该升级,才算真正懂了这套办法。 后来他们还把这套办法交给新人演练:先让新人按旧办法做一遍,看错误怎样出现;再按新规矩重做,看哪一步被提前拦住,哪一步留下了证据。新人若只会背名字,仍会在相似场景里乱用;只有能说出适用边界、代价和失败后的补救,才被允许独立接活。

揭示

这个故事讲的是:可验证奖励强化学习

Reinforcement Learning with Verifiable Rewards, RLVR 是用可程序化验证的结果作为奖励信号来训练模型,例如数学答案能否被校验、代码能否通过测试、SQL 能否返回正确结果。它不同于主要依赖人类偏好判断的对齐方法,更适合答案可被客观验证的推理和执行任务。企业场景中,RLVR 可用于提升 Agent 在工单处理、代码修复、数据查询和流程执行中的可靠性。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 答案箱:可自动验证的任务环境
  • 铜锁是否落下:程序化 reward,只有正确结果才通过
  • 掌声:主观偏好,可能被表达方式误导
  • 修锁匠反复试钥匙:模型通过尝试和奖励改进策略
  • 钥匙形状记录:轨迹、测试用例和可复现反馈
  • 不能装进箱子的事:RLVR 不适合所有开放式判断任务

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

GRPORLHFverifiable tasksmath/code training