HelloAI ← 可视化画廊
🛡️ AI 对齐 · 8 分钟

RLHF 奖励信号:从"哪个回答更好"到训练信号

ChatGPT 之所以"听话",靠的是 人类反馈强化学习。 流程:人挑两个回答里更好的 → 训练奖励模型 → 用它指导主模型 fine-tune。 这个可视化展示前两步。

回答 A
奖励模型 RM 的打分(4 个维度)
总分(综合)
回答 B
奖励模型 RM 的打分(4 个维度)
总分(综合)

📊 三阶段流程

1️⃣
SFT
先用人工标注的指令-回答对监督训练,让模型能"听懂指令"。
2️⃣ ← 你在这里
奖励模型(RM)
用人类偏好(A 比 B 好)训练一个打分模型。
3️⃣
PPO 微调
用 RM 的打分作为奖励,把主模型 fine-tune 到偏好对齐。

⚡ 关键观察

配套
L6-02 RLHF 与 CAI
完整流程 + Constitutional AI 对比
论文
InstructGPT 精读
ChatGPT 的方法学源头