让网格与随机搜索拿到完全相同的试验预算。观察:当真正重要的是跨越多个数量级的学习率时,谁把预算花得更有效?
对数尺度按“数量级”均匀抽样:10⁻⁵ 到 10⁻¹ 的每个十倍区间机会相同。
本实验定义:SGD 分支只搜索 momentum,AdamW 分支只搜索 weight_decay。SGD 也可配置 weight decay,但此处不作为该分支搜索项。
说明:高分带是用于隔离“重要维度”的教学模型,并非真实任务的通用最佳学习率。真实调参还会受模型、数据、批大小和优化器影响。