一条稳妥的解冻路径
- 先固定骨干,只训练新任务头,确认标签、损失和数据管线能正常学习。
- 加载该基线的较优权重,解冻后段;骨干通常使用比新头更小的学习率。
- 若验证证据支持且预算允许,再比较全模型小学习率微调。
- 域差异大或目标数据充足时,加入从头训练基线,避免把“预训练一定有利”当成前提。
这里输出的是“优先验证的候选方案”,不是固定最优答案。数据相对规模、域差异和预算共同决定实验顺序,最终仍要用独立验证集检验。
保持数据划分、评价指标和最大训练预算可比;先跑低成本基线,再按证据扩大解冻范围。
| 运行 | 训练范围 | 学习率思路 | 它回答的问题 |
|---|
验证阶段应采用可复现的 resize / crop 与和预训练权重匹配的归一化,不放入随机裁剪、随机翻转、MixUp 或 CutMix。若要测试时增强,应作为单独、明确记录的推理实验,不能偷偷混进基线。
增强也必须遵守标签不变性:一个变换看似自然,并不表示它不会改变任务语义。