第1步:梯度消失与权重初始化

网络越深越难训?亲眼看梯度逐层消失或爆炸,初始化如何力挽狂澜
网络结构(每格一层,颜色 = 激活均值大小)
各层梯度量级 ‖dW‖(对数刻度 — 从左到右 = 从输入层到输出层,梯度反向传播方向 ←)
各层激活值分布(每层一条折线 — 健康时各层形状相近)

网络配置

操作

梯度比(输出层/输入层)
点击"前向 + 反向一次"开始实验
梯度为什么会消失?
反向传播 = 链式法则连乘。每多一层,梯度就多乘一次"权重 × 激活导数"。 这个因子若平均 < 1,连乘 10 次就趋近 0(消失); 若 > 1,连乘 10 次就爆炸。

Sigmoid 导数最大只有 0.25,是消失重灾区; ReLU 正区间导数恒为 1,天然抗消失。

初始化的艺术:全零让所有神经元"一模一样"(对称死锁,永远学不出差异); 太大 → 激活饱和爆炸;太小 → 信号逐层衰减。 Xavier(配 tanh/sigmoid)与 He(配 ReLU) 按 √(1/输入数)√(2/输入数) 缩放,让每层的信号强度保持一致。

🔰 先修:ML 第 5 步 · 多层感知机 + 反向传播

💡 键盘快捷键:← → 切换章节