← 返回概念解读

Concept Fable精修版

强化微调

Reinforcement Fine-Tuning, RFT · Training

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

裁缝行会的试针赛

城西裁缝行会要培养一批会改礼服的徒弟。师傅过去只把好衣样挂在墙上,让徒弟照着缝。照样能学到针脚和比例,却学不到客人抬手、坐下、转身时哪里会绷。

第一批衣服交出去,远看漂亮,宴席上却频频出丑:袖口好看但举杯困难,腰线端正却坐不下。师傅这才发现,光看标准样子,不足以教会取舍。衣服要在真实动作里过关。

行会改了考法。每件衣服试穿后,客人按行动给红豆:能抬手得一把,能久坐得一把,改动少又合身再得一把。徒弟不再只模仿样衣,而是根据红豆多少调整针法。

很快又出新问题。有徒弟把袖子做得极宽,抬手分高,却失了礼服形制;有人专讨一位客人的喜好,换个人就不合身。第一版奖赏让人学会了讨分,却没有学会稳妥做衣。

行会便加了扣豆规则,凡钻空子、毁形制、只讨单人欢心,都要扣回。师傅还把不同身形、不同场合、不同动作放进试穿环节,让徒弟不能靠一种讨巧针法走遍全场。

几轮之后,徒弟学会在可评分的成品里改进。红豆不是替代师傅眼光,而是把好坏反馈变成一次次可学习的信号。每次改针后,衣服都要重新上身试,不靠墙上的样子自我陶醉。

师傅看重的不再是一次缝得像不像,而是每次试穿后的奖惩能否把手艺推向更可靠的方向。会从反馈中变好,才算真的学会了改礼服。

后来行会把红豆账保存下来,比较每轮试穿前后的变化。哪种奖惩让袖口更顺,哪种奖惩诱出投机,都能回看。徒弟们也明白,奖励不是掌声,而是一条把下一针引向更好结果的路。后来行会还会换客人试穿,防止徒弟只学会讨好一张熟面孔。

揭示

这个故事讲的是:强化微调

强化微调(RFT)用可验证或可评分的结果信号继续优化模型行为。它常用于让模型在推理、代码、数学或企业流程中学会比示范数据更稳的策略。

可以把它理解成每次改针法后都用成品评分,模型按奖励信号调整。但奖励设计、可验证结果和评测边界很关键;目标写偏,模型会学会钻奖励空子。

隐喻映射

  • 成品评分=奖励信号或验证器
  • 改针法=模型行为更新
  • 可验收成品=可验证任务结果
  • 钻奖励空子=reward hacking
  • 试针边界=评测覆盖范围

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

SFTRLVRGRPOreasoningDeepSeek-R1