跳转到主要内容
HelloAI
beta
资讯
学习路径
可视化
论文
工具箱
zh
zh
中文
✓
en
English
资讯
学习路径
可视化
论文
工具箱
所有标签
›
#RLHF
🏷️ 标签
#RLHF
共找到
4
条相关内容:
2 篇学习路径
2 篇论文
📚 学习路径
L4
LLM 是怎么炼成的:Pretrain → SFT → RLHF 全流程
"训练一个 ChatGPT" 不是一步,是三步。每一步用完全不同的数据和目标。看完你能跟工程师对话。
🐣 · 11 分
L6
RLHF 与 Constitutional AI:两大对齐方法对比
OpenAI 用 RLHF,Anthropic 用 CAI。它们都让 LLM "听话",但思路完全不同。
🐥 · 10 分
📑 论文精读
2023
Direct Preference Optimization (DPO)
把 RLHF 简化成一个简单的损失函数——跳过奖励模型和 PPO,效果接近,工程简单 10 倍。开源 LLM 对齐的事实标准。
🏆
2022
Training language models to follow instructions with human feedback (InstructGPT)
从 GPT-3 到 ChatGPT 的"桥梁"。提出 SFT + RLHF 三阶段训练让 LLM "听话"——这套流程定义了之后所有商业 LLM 的训练范式。
🏆
← 回到所有标签
⌨️ 键盘快捷键
×
唤起搜索
/
回首页
g
然后
h
学习路径
g
然后
l
可视化画廊
g
然后
v
论文精读
g
然后
p
工具箱
g
然后
t
资讯
g
然后
n
显示这个面板
?
关闭面板 / 弹窗
Esc
💡 输入框聚焦时快捷键自动失效。