寓言故事
评委只说哪盘菜更好,厨师就改了手法
画坊训练学徒画门神,师傅没有时间逐笔标分。买主面对同一题目的两幅画,通常能说出更愿意挂哪一幅,却很难为眉眼、衣纹逐项打分。
老师傅收集每次成对选择,并记录题目、画风和评审背景。被选中的画是 chosen,另一幅是 rejected;这份关系比一张主观总分更接近买主的偏好。
学徒用这些选择调整画法,让同一题目下更受偏好的作品概率上升,另一幅相对下降。画坊没有先另造一位长期打分的评委,也没有把每次练习都变成在线试错。
不同买主的标准并不总是一致。画坊分开评审人群,检查偏好冲突、题目覆盖和过拟合,保留独立作品测试真实改进。
DPO 的关键是直接利用偏好对优化模型;流程更短不代表数据要求更低,偏好来源和验证集仍决定对齐是否可信。