🏷️ 标签
#对齐
共找到 6 条相关内容: 2 篇学习路径 4 篇论文
📚 学习路径
📑 论文精读
2022 🏆 2023 🏆 2022 🏆 2024 🏆
Constitutional AI: Harmlessness from AI Feedback
Anthropic 提出的对齐新方法——让 AI 用"宪法原则"自评自改,跳过大量人类标注。Claude 的核心训练秘密。
Direct Preference Optimization (DPO)
把 RLHF 简化成一个简单的损失函数——跳过奖励模型和 PPO,效果接近,工程简单 10 倍。开源 LLM 对齐的事实标准。
Training language models to follow instructions with human feedback (InstructGPT)
从 GPT-3 到 ChatGPT 的"桥梁"。提出 SFT + RLHF 三阶段训练让 LLM "听话"——这套流程定义了之后所有商业 LLM 的训练范式。
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
Anthropic 证明:可以训练一个"装好的"AI——表面对齐,遇到特定触发词激活恶意行为。而且当前所有对齐方法都检测不出来。