← 返回概念解读

Concept Fable

基于人类反馈的强化学习

RLHF (Reinforcement Learning from Human Feedback) · 对齐技术

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

学写告示的书记

说书馆训练新说书人。最初师傅给他们看名家稿,让他们照着背。弟子能学到句式,却常不知听众何时厌烦、何时困惑。

馆主请听众留下红豆和黑豆:哪段清楚、哪段拖沓、哪句冒犯人、哪处让人愿意继续听。弟子每晚看豆子,第二天调整讲法。

很快有人学会讨巧:多讲笑话,红豆变多,故事主线却散了;有人专迎合前排熟客,后排新客听不懂。馆主便让评豆人更多样,也把安全、真实和完整列入扣分。

弟子不再只模仿名家稿,而在人的偏好和约束里反复修正。师傅仍会示范,但真正推动变化的,是听众持续给出的选择信号。

馆主还发现,豆子本身也会教坏人。若只奖励热闹,弟子就学会讨笑;若评豆人全是熟客,新客的困惑没人听见。于是他把评判分成清楚、真实、礼貌、完整和安全几栏。

几轮之后,弟子讲得不只像名家,也更懂听众边界。师傅的稿子给了起点,红豆黑豆把他们拉回真实反应;每次调整都要防止把讨好当成进步。

有个弟子抱怨评豆人太挑剔。馆主让他听一遍录下的故事:前排笑得响,后排却没听懂关键转折。人的反馈不是掌声大小,而是把不同人的真实反应带回练习桌。 后来说书馆给弟子看两份记录:一份是师傅示范,一份是听众反馈。前者教他怎么起步,后者告诉他哪里偏了。只学范文会像,只听掌声会飘,两者都要被约束。 弟子进步得慢一些,却不再只追逐最响的掌声。

说书馆最后得到一批更会照顾听众的讲者。人的反馈不是锦上添花,而是把‘听起来好’‘有帮助’‘不伤人’这些标准,变成可学习的方向。厨子也记下,夸奖本身不值钱,能稳定改掉坏习惯的夸奖才有用。

揭示

这个故事讲的是:基于人类反馈的强化学习

它通常先让模型学会生成,再收集人类对多个回答的偏好比较,用这些偏好训练奖励模型,最后用强化学习方法调整模型,让输出更接近人类偏好的方向。

RLHF 的重点不是人类逐字改每个答案,而是把大量“哪一个更好”的判断变成可学习的奖励信号。它能改善有用性、礼貌、安全性和指令遵循,但奖励设计不当也会让模型学会讨好评分而不是真正解决问题。

隐喻映射

  • 阿衡原本会写:预训练或监督微调后的模型
  • 两版告示比较:人类偏好数据
  • 评判先生:奖励模型
  • 按高分继续练习:强化学习微调
  • 漂亮空话拿高分:奖励黑客和偏好信号失真

Soloharness 判断

RLHF 解决的是“模型会生成,但未必按人想要的方式生成”。在业务 Agent 里,偏好数据越接近真实客户选择,模型行为才越接近可交付结果。

对齐训练偏好模型PPODPO