第2步:优化器:从 SGD 到 Adam

四种优化器在损失曲面上赛跑 — 动量冲过震荡,自适应学习率各走各的步长
损失曲面等高线
损失-迭代曲线

实验配置

操作

迭代 0 / 800
SGD
Momentum
RMSProp
Adam
四种优化器,四种走法
SGD:每一步沿当前梯度走 — 简单直接,但在"窄碗"里会来回震荡。
Momentum:像滚下坡的球一样积累速度,冲过小震荡,狭谷里越滚越快。
RMSProp:梯度大的方向自动缩小步长(除以梯度平方的滑动平均),各方向步长更均衡。
Adam:动量 + 自适应步长合体,再加偏差校正 — 今天训练深度网络的默认选择。

观察建议:椭圆碗里看 SGD 的 zigzag;鞍面上比谁先在鞍点附近"卡住"、谁先找到下坡方向滚出去;把学习率调大,看谁在震荡中直接发散。

🔰 先修:ML 第 1 步 · 线性回归 + 梯度下降

💡 键盘快捷键:← → 切换章节