预热 + 余弦
训练初期逐步升温,之后平滑降到最低值。总训练预算明确时,曲线易解释且无需观察指标触发。
常见于:Transformer、固定 step 的大规模预训练或微调大学习率帮助快速移动,小学习率帮助细致收敛。调度器不是自动变好的魔法,而是一套明确的“何时、为何改变步长”的规则。
每个方格代表一次验证。刷新最佳值会把等待计数清零;否则计数加一。计数达到 patience 时,下一个训练区间使用更小学习率。紫底且标“触发”的方格同时用文字标记,颜色不是唯一提示。
训练初期逐步升温,之后平滑降到最低值。总训练预算明确时,曲线易解释且无需观察指标触发。
常见于:Transformer、固定 step 的大规模预训练或微调每隔固定 step 把学习率乘以 γ。变化清楚,便于复现实验;但断点若选得不合适,会过早或过晚降速。
常见于:已有成熟经验里程碑的训练配方验证指标不再改善时才降速。它响应训练反馈,但触发频率受验证噪声、评估间隔和 patience 共同影响。
常见于:预算弹性较大、需要按验证表现调整的任务为什么 warmup 结束点不能超过总 step?
因为余弦衰减至少需要一个后续区间。若 warmup 占满训练,整段只剩升温,不再有从峰值退火到低学习率的阶段。
平台调度中,某次验证损失略高于历史最佳值,但低于上一次验证值,等待计数会清零吗?
按本实验“必须刷新历史最佳值”的语义,不会清零。它比的是 best,而不是只和上一次结果比较。