🧠 深度学习 · 8 分钟
Backprop:梯度怎么从 loss 一路传回参数
一个迷你 2 层网络:输入 → 隐藏(2 神经元)→ 输出 → loss。
点击 Forward / Backward 看数据怎么走过去 + 梯度怎么传回来。
数据流(forward)
梯度流(backward)
参数节点
① 初始状态
网络结构:1 个输入 x → 2 个隐藏神经元(用 sigmoid 激活)→ 1 个输出 ŷ → MSE loss。
参数 W1, W2 是要学的东西。
点击上面的按钮一步步看 forward 和 backward 怎么发生。
⚡ 关键观察
- Forward 只用局部规则:每个节点用上游输入算自己的输出。
- Backward 用链式法则:梯度 = 下游梯度 × 本地导数。
- ∂L/∂W1 不是 1 次计算——它是 ∂L/∂ŷ × ∂ŷ/∂h × ∂h/∂W1 的乘积。
- 学习率 η 大 → 一步走得远(可能跳过最小值);η 小 → 收敛慢。试试调到 2.0 看 loss 是否震荡。
- 真实网络是 12-100 层 × 这种结构 —— 但每一层的数学完全一样。