HelloAI
🏷️ 标签

#L6

共找到 8 条相关内容: 8 篇学习路径

📚 学习路径

L6
为什么需要 AI 对齐:从对错到价值观
能力越强的 AI,对齐越关键。这一篇讲清楚"对齐"到底是什么,为什么它是 AI 时代最重要的研究方向之一。
L6
RLHF 与 Constitutional AI:两大对齐方法对比
OpenAI 用 RLHF,Anthropic 用 CAI。它们都让 LLM "听话",但思路完全不同。
L6
红队与越狱:攻击 LLM 的方法与防御
AI 安全的"反派"视角——专门找模型漏洞的人在做什么。理解攻击才能防御。
L6
机制可解释性:看见神经元在想什么
LLM 是黑盒——但研究者已经能从几百亿参数里"读出"具体的概念了。这一篇带你认识 AI 内部的"心理学"研究。
L6
偏见与公平:AI 学到的不止是规则,还有人类的"暗面"
训练数据是人类社会的镜像——AI 学到的"模式"包含了所有偏见、刻板印象、不公平。这一篇直面这个问题。
L6
AI 政策与监管:EU AI Act / 美国 EO / 中国办法对照
AI 公司和应用面临的法律义务正在快速演化。这一篇给你全球三大法域的对照表 + 影响。
L6
AI 安全研究入门:怎么进入这个方向
想做 AI 安全研究?这一篇讲方向、机构、起步项目、推荐阅读——这是 2026 年最稀缺的人才方向之一。
L6
CoT 安全:推理模型的"思考"可信吗
Anthropic 2025 实证:Claude 3.7 与 DeepSeek R1 的思维链只有 25-39% 的时候诚实——CoT 监控不能完全代替 alignment。