SGD:只看此刻坡度
当前位置的梯度指向最快上升方向,SGD 反向走一步。在陡峭横轴上,它常跨越谷底来回摆动。
θ ← θ − η∇L(θ)
三位优化器从同一点出发。山谷横向陡、纵向缓:普通 SGD 容易左右摆动;动量会积累方向;Nesterov 则先“向前看”再修正。
当前位置的梯度指向最快上升方向,SGD 反向走一步。在陡峭横轴上,它常跨越谷底来回摆动。
速度保留此前梯度的合力,能压低横向反复、积累沿谷方向的进展。μ 太大时也可能冲过头。
先用动量估计下一位置,再在那里求梯度。这个“前瞻”让修正更早发生,但并不保证任何学习率都稳定。
学习率升高后,三条轨迹突然冲出画布,这更可能说明什么?
最可能是更新步长超过了当前曲率允许的稳定范围。它不是“优化器探索得更远”,而是数值发散信号。
Nesterov 与 Momentum 的核心差别在哪里?
两者都积累速度;Nesterov 在动量预测的前瞻位置计算梯度,因而能更早感知将要出现的偏离并修正。