HelloAI
🧠
L3

深度学习

MLP、CNN、RNN、Attention、Transformer

10 篇文章 106 分钟阅读 26 个 tag
第 1 篇 🐣 9 分钟 #感知机#神经网络#激活函数

从感知机到多层神经网络:深度学习的起点

所有神经网络都是从一个 1958 年的简单模型扩展来的。这一篇讲清楚"神经元"到底是个啥。

第 2 篇 🐣 8 分钟 #反向传播#梯度#链式法则

反向传播详解:链式法则的实战

Backpropagation 让神经网络真的能学。这一篇拆解它的数学、直觉、和实现。

第 3 篇 🐣 10 分钟 #BatchNorm#Dropout#正则化

深网络训练技巧:BatchNorm / Dropout / 初始化

让深层网络真的能训起来的三大件——为什么需要它们、怎么用、什么时候用。

第 4 篇 🐣 9 分钟 #RNN#LSTM#序列建模

RNN / LSTM 兴衰:序列模型简史

2017 年 Transformer 出现前,所有处理语言/语音的 AI 都靠 RNN 和它的衍生品。理解它的兴衰,才理解为什么 attention 是革命。

第 5 篇 🐣 13 分钟 #Transformer#Attention#Q-K-V

注意力机制详解:从直觉到完整推导

Attention is all you need. 这一篇带你从"它到底在干嘛"到"它的每行公式",一次性吃透 Transformer 的核心。

第 6 篇 🐣 9 分钟 #CNN#卷积#视觉

CNN 卷积原理:从滤镜到 ResNet

在 Transformer 称霸前,CNN 是计算机视觉的统治者。它今天仍然是处理图像的标配。这一篇讲清楚"卷积"到底是什么。

第 7 篇 🐥 11 分钟 #Attention#注意力变体#L3

注意力变体:Multi-Head / Cross / Sparse / Linear

Self-Attention 之后还有什么?讲清楚现代 Transformer 各种注意力家族成员。

第 8 篇 🐥 13 分钟 #Transformer#BERT#GPT

完整 Transformer 架构:把所有积木组合起来

注意力是核心,但 Transformer 还有位置编码、FFN、残差连接、LayerNorm。这一篇把它们组合成一个完整可跑的模型。

第 9 篇 🐣 11 分钟 #BERT#GPT#Transformer

BERT vs GPT:两大 LLM 流派的本质区别

都是 Transformer,为啥一个做"理解"一个做"生成"?两者的训练目标差一个根本性的设计选择。

第 10 篇 🐥 13 分钟 #GAN#VAE#生成模型

GAN 与 VAE:生成模型的两条路线

Diffusion 之前主导生成 AI 的两大架构。理解它们才理解为什么 Diffusion 赢了。

📍 学完之后
L4:LLM 和生成式 AI