← 返回概念解读

Concept Fable精修版

偏好数据

Preference Data · Alignment

先读故事。这里不急着给定义,先让问题自己长出来。

寓言故事

两份回信之间,老客户选了哪一份

商号的信房每天替掌柜回客户。新伙计能写得通顺,却常把重点放错:有的太热情,有的太含糊,有的越过了授权边界。掌柜先收集一批标准答案。可很多时候,两个答案都说得过去,真正差别在语气、风险、清晰度和是否敢承认不知道。于是他把同一封来信交给两名伙计,各写一份回信,再请老客户和资深掌柜选择更好的一份。评审不只勾选喜欢谁,还标注原因:这一份保留证据,那一份承诺过头;这一份先澄清条件,那一份直接编了结论。

刚开始,信房混进了很多随手选择。有人只偏爱短句,有人只偏爱漂亮话,数据里没有说明业务目标。

掌柜重新制定规则:每个选择必须对应明确标准,样本要覆盖常见任务、危险边界和企业客户最在意的失败。

这些成对选择后来成了练习材料。伙计不只是模仿单一标准答案,而是学习在相近答案之间做取舍。

信房也保留争议样本。若评审意见分裂,说明规则本身需要澄清,不能把混乱偏好直接灌进练习。

掌柜最后说:偏好不是一句“我喜欢”,而是把真实取舍变成机关可学习的证据。

一次大客户投诉,年轻伙计写得很客气,却把赔付条件说死;另一封信短一些,却先承认不确定,再请客户补合同页。老掌柜选了后一封,并把理由写进评审簿。

后来新伙计翻评审簿时,看到的不是谁文采好,而是哪些取舍更接近商号要守的边界。信房终于少了漂亮但危险的回信,多了能被业务承担的判断。后来每次新人上岗,掌柜都让他先读这些取舍记录,再动笔回第一封信。信房的手艺,也从会写变成会选。好坏从此有了可追的理由。

揭示

这个故事讲的是:偏好数据

Preference Data 是用于训练奖励模型、DPO、RLHF、RLAIF 或其他偏好优化方法的数据,通常包含同一输入下多个响应及其排序、选择或评分。它表达的是“哪种行为更被接受”,而不只是标准答案。高质量偏好数据需要明确评审标准、覆盖业务边界、控制标注偏差、处理冲突样本,并记录选择原因。企业对齐 Agent 时,偏好数据常来自人工评审、专家审核、用户反馈、AI 评审和生产日志抽样。

它重要的地方在于:它不只是一个术语,而是在真实 AI / Agent 系统里会反复出现的结构性问题。理解它,才能判断什么时候该加模型,什么时候该改流程,什么时候该补治理。

隐喻映射

  • 同一封来信的两份回信:同一 prompt 下的多个 candidate responses
  • 老客户和资深掌柜选择:human preference annotation
  • 选择原因:偏好标准和解释
  • 随手选择:噪声标签
  • 争议样本:偏好冲突和政策不清
  • 训练材料:RLHF、DPO 或 reward model 数据
  • 最后洞察:Preference Data 把人类和组织的取舍转成模型可优化的信号

Soloharness 判断

这个概念的实战价值,是帮你把“看起来聪明的 AI 功能”拆成可交付、可验收、可治理的工作单元。

RLHFDPOreward model