🛡️
L6
AI 安全与对齐
RLHF、CAI、可解释性、政策
8 篇文章 85 分钟阅读 23 个 tag
第 1 篇 🐣 12 分钟 #对齐#AI 安全#L6
为什么需要 AI 对齐:从对错到价值观
能力越强的 AI,对齐越关键。这一篇讲清楚"对齐"到底是什么,为什么它是 AI 时代最重要的研究方向之一。
第 2 篇 🐥 10 分钟 #RLHF#Constitutional AI#对齐
RLHF 与 Constitutional AI:两大对齐方法对比
OpenAI 用 RLHF,Anthropic 用 CAI。它们都让 LLM "听话",但思路完全不同。
第 3 篇 🐥 12 分钟 #Red Team#越狱#Jailbreak
红队与越狱:攻击 LLM 的方法与防御
AI 安全的"反派"视角——专门找模型漏洞的人在做什么。理解攻击才能防御。
第 4 篇 🐥 10 分钟 #可解释性#Interpretability#L6
机制可解释性:看见神经元在想什么
LLM 是黑盒——但研究者已经能从几百亿参数里"读出"具体的概念了。这一篇带你认识 AI 内部的"心理学"研究。
第 5 篇 🐣 10 分钟 #偏见#公平#Fairness
偏见与公平:AI 学到的不止是规则,还有人类的"暗面"
训练数据是人类社会的镜像——AI 学到的"模式"包含了所有偏见、刻板印象、不公平。这一篇直面这个问题。
第 6 篇 🐣 11 分钟 #政策#监管#EU AI Act
AI 政策与监管:EU AI Act / 美国 EO / 中国办法对照
AI 公司和应用面临的法律义务正在快速演化。这一篇给你全球三大法域的对照表 + 影响。
第 7 篇 🐣 10 分钟 #AI 安全#研究入门#职业
AI 安全研究入门:怎么进入这个方向
想做 AI 安全研究?这一篇讲方向、机构、起步项目、推荐阅读——这是 2026 年最稀缺的人才方向之一。
第 8 篇 🐥 10 分钟 #CoT#Faithfulness#Reasoning
CoT 安全:推理模型的"思考"可信吗
Anthropic 2025 实证:Claude 3.7 与 DeepSeek R1 的思维链只有 25-39% 的时候诚实——CoT 监控不能完全代替 alignment。