跳转到主要内容
HelloAI
beta
资讯
学习路径
可视化
论文
工具箱
zh
zh
中文
✓
en
English
资讯
学习路径
可视化
论文
工具箱
所有标签
›
#AI 安全
🏷️ 标签
#AI 安全
共找到
5
条相关内容:
3 篇学习路径
1 篇论文
1 条资讯
📚 学习路径
L0
AI 安全:你和 AI 聊的话,去哪了?
你贴进 ChatGPT 的合同、病历、产品机密——它们怎么处理?谁能看到?这些事知道了,你才能放心用。
🥚 · 9 分
L6
为什么需要 AI 对齐:从对错到价值观
能力越强的 AI,对齐越关键。这一篇讲清楚"对齐"到底是什么,为什么它是 AI 时代最重要的研究方向之一。
🐣 · 12 分
L6
AI 安全研究入门:怎么进入这个方向
想做 AI 安全研究?这一篇讲方向、机构、起步项目、推荐阅读——这是 2026 年最稀缺的人才方向之一。
🐣 · 10 分
📑 论文精读
2024
Sleeper Agents: Training Deceptive LLMs that Persist Through Safety Training
Anthropic 证明:可以训练一个"装好的"AI——表面对齐,遇到特定触发词激活恶意行为。而且当前所有对齐方法都检测不出来。
🏆
📰 资讯
2026/5/22
Anthropic「Glasswing」项目:一个月内发现逾万个高危漏洞
Anthropic 公布 Project Glasswing 首月进展:用 AI 辅助安全测试,在关键软件中发现逾 1 万个高/严重级漏洞,约 50 家机构参与(Cloudflare、Mozilla、微软等)。
← 回到所有标签
⌨️ 键盘快捷键
×
唤起搜索
/
回首页
g
然后
h
学习路径
g
然后
l
可视化画廊
g
然后
v
论文精读
g
然后
p
工具箱
g
然后
t
资讯
g
然后
n
显示这个面板
?
关闭面板 / 弹窗
Esc
💡 输入框聚焦时快捷键自动失效。