第2步:优化器:从 SGD 到 Adam
四种优化器在损失曲面上赛跑 — 动量冲过震荡,自适应学习率各走各的步长
损失曲面等高线
损失-迭代曲线
实验配置
操作
迭代 0 / 800
● SGD —
● Momentum —
● RMSProp —
● Adam —
● SGD —
● Momentum —
● RMSProp —
● Adam —
四种优化器,四种走法
SGD:每一步沿当前梯度走 — 简单直接,但在"窄碗"里会来回震荡。
Momentum:像滚下坡的球一样积累速度,冲过小震荡,狭谷里越滚越快。
RMSProp:梯度大的方向自动缩小步长(除以梯度平方的滑动平均),各方向步长更均衡。
Adam:动量 + 自适应步长合体,再加偏差校正 — 今天训练深度网络的默认选择。
观察建议:椭圆碗里看 SGD 的 zigzag;鞍面上比谁先在鞍点附近"卡住"、谁先找到下坡方向滚出去;把学习率调大,看谁在震荡中直接发散。
🔰 先修:ML 第 1 步 · 线性回归 + 梯度下降
SGD:每一步沿当前梯度走 — 简单直接,但在"窄碗"里会来回震荡。
Momentum:像滚下坡的球一样积累速度,冲过小震荡,狭谷里越滚越快。
RMSProp:梯度大的方向自动缩小步长(除以梯度平方的滑动平均),各方向步长更均衡。
Adam:动量 + 自适应步长合体,再加偏差校正 — 今天训练深度网络的默认选择。
观察建议:椭圆碗里看 SGD 的 zigzag;鞍面上比谁先在鞍点附近"卡住"、谁先找到下坡方向滚出去;把学习率调大,看谁在震荡中直接发散。
🔰 先修:ML 第 1 步 · 线性回归 + 梯度下降
💡 键盘快捷键:← → 切换章节