多元线性回归 · 数值优化实验

同一个学习率,为什么走出两条完全不同的路?

改变特征之间的尺度差异,观察缩放前后的损失等高线与梯度下降轨迹。蓝线是同一二次损失的等值线,橙线上的每一步都由当前梯度真实计算。

θ 下一步 = θ 当前 − η × Hθ

实验旋钮

两侧使用相同起点、学习率与迭代次数。

缩放前:狭长损失谷

条件数 κ = --
浏览器需要支持 Canvas 才能显示实验图。 第 36 / 36 步
当前损失--
稳定性--
到达最优邻域--

标准化后:近圆损失碗

条件数 κ = --
浏览器需要支持 Canvas 才能显示实验图。 第 36 / 36 步
当前损失--
稳定性--
到达最优邻域--

此刻的结论

计算说明:令相关结构 C = [[1, 0.25], [0.25, 1]],尺度矩阵 D = diag(1, s)。缩放前 Hessian 为 H = DCD,标准化后为 H = C;因此两幅图对应同一回归问题在两套参数坐标中的表示。判定“到达最优邻域”的阈值为损失小于 0.01。