🧠 深度学习 · 12 分钟
8 个注意力 Head 各学到了什么
Multi-Head Attention 的每个 head 学到一种关系模式 ——
近邻 / 句法 / 指代 / 标点 ... 这就是机制可解释性研究的入口。
点击不同 head,看它在关注什么。
— 选择一个 head —
每个 head 在训练后会自发学到不同的"看法"。
点击任意 token = query
高亮 = 该 head 在关注
Attention 矩阵(行 = query,列 = key)
每行加起来 = 1(softmax)。紫深 = 高注意力
⚡ 机制可解释性的入口
- 没有人告诉 head 1 关注"上一个 token" —— 它是训练中自发学到的。
- 同一句话不同 head 看法完全不同 —— 像 8 个分析员从不同角度读同一段话。
- 这些"模式"是 Anthropic / Apollo Research 等机构在做的机制可解释性研究 —— 一层一层把模型行为拆解。
- 真实 LLM 有 12-96 层 × 8-96 head,远比这个 1 层 8 head 的玩具复杂。
- 这里展示的是经典论文中观察到的真实模式,但具体数值是手工设计的(便于直观)。