L6 · 由简入深系列 · 对齐核心

10 章,搞懂 RLHF:怎么让大模型「说得对、不胡来」

全程中文 · 从「为什么要人类反馈」讲到「DPO 无强化学习对齐」· 三个交互实验台

📌 这是 L6(对齐核心层)。学完你能讲清 ChatGPT 式对齐的底层逻辑:奖励模型、PPO、KL 约束、奖励黑客,以及当下最火的 DPO。建议先学完 L1~L5——本阶会用到 L4 的偏好概念、L5 的微调与训练曲线。
💡 怎么用:每天点开一张卡片,先读教程再玩下面的演示;学完勾选「我已掌握」,进度条会自动增长(保存在你本机浏览器)。三个演示台建议在浏览器里亲手试——奖励模型怎么打分、PPO 循环怎么跑、DPO 为什么不用奖励模型,亲手拖一遍比读十遍都清楚。

📊 我的学习进度

已完成 0 / 10 章

🗺️ 10 章学习路线

🎮 互动演示(真实计算,浏览器内运行)

三个演示台都基于真实公式在浏览器里实时计算,不依赖外部模型——点一点、拖一拖,直观感受 RLHF 的精髓。

① 奖励模型打分台:偏好数据怎么变成分数

给同一个问题两个回答,你来评判谁更好。奖励模型正是从这种「比较」里学会打分——用 Bradley-Terry 公式把偏好变成概率。
问题:用一句话向小学生解释「为什么天是蓝的」。
A:太阳光里有各种颜色,蓝光波长比较短、容易被空气里的小颗粒散射到四面八方,所以抬头看天空时,眼睛接收到最多的就是蓝光。
B:因为天空本来就是蓝的啊,这是大自然的颜色,你看云是白的、天是蓝的。
奖励模型给 A
奖励模型给 B
P(A 优于 B)
训练后 RM 对齐 未选择
点击上面任一按钮,模拟「人类标注」:奖励模型会根据你的选择,把偏好的回答分数调高、另一份调低(这正是偏好数据的训练目标)。

② PPO 训练循环台:奖励与 KL 的拉锯战

四步一轮:①生成回答 → ②奖励模型打分 → ③算 KL 散度(防跑偏) → ④PPO 更新。拖动「KL 系数 β」看两种极端:β 太小→奖励黑客(KL 爆炸),β 太大→奖励涨不动。
0.03
30
RM 奖励
与初始策略的 KL
状态

③ DPO 损失对比台:没有奖励模型也能对齐

DPO 把「奖励模型 + 强化学习」压缩进一个监督损失:直接让「被选中的回答」比「被拒绝的回答」概率更高。拖动训练进度,看损失如何降到 0。
5.0
选定−拒绝 对数概率差
DPO 损失
P(偏好选定)

📚 教程目录(10 章原创中文)

🔗 系列阶梯

L1 AI 入门L2 大模型原理L3 深度学习L4 RAG 与 AgentL5 微调与部署L6 RLHF(本阶)L7 AIGC → L8 多模态/MCP