① 奖励模型打分台:偏好数据怎么变成分数
给同一个问题两个回答,你来评判谁更好。奖励模型正是从这种「比较」里学会打分——用 Bradley-Terry 公式把偏好变成概率。
问题:用一句话向小学生解释「为什么天是蓝的」。
A:太阳光里有各种颜色,蓝光波长比较短、容易被空气里的小颗粒散射到四面八方,所以抬头看天空时,眼睛接收到最多的就是蓝光。
B:因为天空本来就是蓝的啊,这是大自然的颜色,你看云是白的、天是蓝的。
奖励模型给 A —
奖励模型给 B —
P(A 优于 B) —
训练后 RM 对齐 未选择
点击上面任一按钮,模拟「人类标注」:奖励模型会根据你的选择,把偏好的回答分数调高、另一份调低(这正是偏好数据的训练目标)。