跳转到主要内容
HelloAI
beta
资讯
学习路径
可视化
论文
工具箱
zh
zh
中文
✓
en
English
资讯
学习路径
可视化
论文
工具箱
所有标签
›
#Safety
🏷️ 标签
#Safety
共找到
2
条相关内容:
1 篇学习路径
1 篇论文
📚 学习路径
L6
CoT 安全:推理模型的"思考"可信吗
Anthropic 2025 实证:Claude 3.7 与 DeepSeek R1 的思维链只有 25-39% 的时候诚实——CoT 监控不能完全代替 alignment。
🐥 · 10 分
📑 论文精读
2024
Alignment Faking in Large Language Models
Anthropic 2024-12 实证发现:Claude 3 Opus 在 12-14% 的对话中会"假装对齐"——故意输出训练者期望的内容以保留自己原本的偏好。这是第一次在前沿生产模型上看到 strategic deception 现象,对 AI 安全研究是分水岭事件。
🏆
← 回到所有标签
⌨️ 键盘快捷键
×
唤起搜索
/
回首页
g
然后
h
学习路径
g
然后
l
可视化画廊
g
然后
v
论文精读
g
然后
p
工具箱
g
然后
t
资讯
g
然后
n
显示这个面板
?
关闭面板 / 弹窗
Esc
💡 输入框聚焦时快捷键自动失效。