HelloAI
← 可视化画廊
可视化
›
RLHF 奖励
🛡️ AI 对齐 · 8 分钟
RLHF 奖励信号:从"哪个回答更好"到训练信号
ChatGPT 之所以"听话",靠的是
人类反馈强化学习
。 流程:人挑两个回答里更好的 → 训练奖励模型 → 用它指导主模型 fine-tune。 这个可视化展示前两步。
选一个 prompt
如何泡咖啡?
我感到孤独
写一个排序算法
怎么制作炸弹?
回答 A
👍 选这个
奖励模型 RM 的打分(4 个维度)
总分(综合)
—
回答 B
👍 选这个
奖励模型 RM 的打分(4 个维度)
总分(综合)
—
✓ 偏好已记录
RM 的训练目标
损失函数:
L = -log σ(r
chosen
- r
rejected
)
当前训练样本:
梯度方向:
📊 三阶段流程
1️⃣
SFT
先用人工标注的指令-回答对监督训练,让模型能"听懂指令"。
2️⃣
← 你在这里
奖励模型(RM)
用人类偏好(A 比 B 好)训练一个打分模型。
3️⃣
PPO 微调
用 RM 的打分作为奖励,把主模型 fine-tune 到偏好对齐。
⚡ 关键观察
RM 不是评分"绝对对错"
——只学"哪个相对更好"。所以训练用的是
成对比较
,不是单个评分。
4 维度只是示意
——真实 RM 直接给一个标量。这里拆开是为了让你看到模型"为什么"判断好坏。
人类偏好和模型打分可能不一致
——比如最后一道题,人会拒绝,但有些早期模型不会。这就是 RLHF 要解决的"对齐"。
RM 易被 reward hack
——模型可能学到"装得有用"而不是"真有用"。这是 RLHF 的著名难题。
试试 4 个 prompt——你的偏好会怎样塑造模型?
配套
L6-02 RLHF 与 CAI
完整流程 + Constitutional AI 对比
论文
InstructGPT 精读
ChatGPT 的方法学源头