搜索空间工作台

让网格与随机搜索拿到完全相同的试验预算。观察:当真正重要的是跨越多个数量级的学习率时,谁把预算花得更有效?

CH.07|实验 01
重新采样
宽度范围32 — 512横轴统一;网格会等距枚举,随机搜索连续抽样。

对数尺度按“数量级”均匀抽样:10⁻⁵ 到 10⁻¹ 的每个十倍区间机会相同。

网格搜索

不同学习率命中高分带

随机搜索

不同学习率命中高分带
网格点随机点教学设定的高分学习率带:3×10⁻⁴~2×10⁻³黑色描边=命中

条件搜索空间:只抽取真正生效的参数

共同参数
learning_rate, hidden_width
SGD 分支
momentum ∈ [0, 0.99]
AdamW 分支
weight_decay ∈ [10⁻⁶, 10⁻²]

本实验定义:SGD 分支只搜索 momentum,AdamW 分支只搜索 weight_decay。SGD 也可配置 weight decay,但此处不作为该分支搜索项。

#宽度学习率优化器有效条件参数高分带

即时判断

1. 学习率跨越 10⁻⁵~10⁻¹,哪种采样更容易让各数量级得到相近关注?

2. 选择 AdamW 后,条件空间应该怎样处理 momentum?