Teacher Forcing 双轨实验

同一个模型,训练时沿真实前缀行驶,推理时沿自己的预测行驶。在任意一步制造偏差,看后续条件如何被改写。

条件不同 → 分布不同

训练轨:Teacher forcing

下一步输入始终是真实 token

推理轨:自由生成

下一步输入来自模型上一预测
训练条件
y*₍<t₎:来自数据集的真实前缀
推理条件
ŷ₍<t₎:来自模型已经生成的前缀
暴露偏差
模型训练时很少见到自己的错误前缀,推理时却必须在这种前缀上继续预测。
真实条件模型条件