🏷️ 标签
#L3
共找到 10 条相关内容: 10 篇学习路径
📚 学习路径
L3 L3 L3 L3 L3 L3 L3 L3 L3 L3
从感知机到多层神经网络:深度学习的起点
所有神经网络都是从一个 1958 年的简单模型扩展来的。这一篇讲清楚"神经元"到底是个啥。
反向传播详解:链式法则的实战
Backpropagation 让神经网络真的能学。这一篇拆解它的数学、直觉、和实现。
深网络训练技巧:BatchNorm / Dropout / 初始化
让深层网络真的能训起来的三大件——为什么需要它们、怎么用、什么时候用。
RNN / LSTM 兴衰:序列模型简史
2017 年 Transformer 出现前,所有处理语言/语音的 AI 都靠 RNN 和它的衍生品。理解它的兴衰,才理解为什么 attention 是革命。
注意力机制详解:从直觉到完整推导
Attention is all you need. 这一篇带你从"它到底在干嘛"到"它的每行公式",一次性吃透 Transformer 的核心。
CNN 卷积原理:从滤镜到 ResNet
在 Transformer 称霸前,CNN 是计算机视觉的统治者。它今天仍然是处理图像的标配。这一篇讲清楚"卷积"到底是什么。
注意力变体:Multi-Head / Cross / Sparse / Linear
Self-Attention 之后还有什么?讲清楚现代 Transformer 各种注意力家族成员。
完整 Transformer 架构:把所有积木组合起来
注意力是核心,但 Transformer 还有位置编码、FFN、残差连接、LayerNorm。这一篇把它们组合成一个完整可跑的模型。
BERT vs GPT:两大 LLM 流派的本质区别
都是 Transformer,为啥一个做"理解"一个做"生成"?两者的训练目标差一个根本性的设计选择。
GAN 与 VAE:生成模型的两条路线
Diffusion 之前主导生成 AI 的两大架构。理解它们才理解为什么 Diffusion 赢了。