HelloAI ← 可视化画廊
🧠 深度学习 · 12 分钟

8 个注意力 Head 各学到了什么

Multi-Head Attention 的每个 head 学到一种关系模式 —— 近邻 / 句法 / 指代 / 标点 ... 这就是机制可解释性研究的入口。 点击不同 head,看它在关注什么

— 选择一个 head —
每个 head 在训练后会自发学到不同的"看法"。
点击任意 token = query
高亮 = 该 head 在关注
当前查询:
注意力最高的 3 个目标:
Attention 矩阵(行 = query,列 = key)
每行加起来 = 1(softmax)。紫深 = 高注意力

⚡ 机制可解释性的入口

基础
L3-05 注意力机制详解
Q K V 公式
进阶
L3-07 注意力变体
Multi-Head / GQA / RoPE
研究
L6-04 机制可解释性
看见神经元在想什么