教师强制与推理错位实验台

这是一个受控的前缀实验:同一组预测阈值下,训练路径可以用真实词纠偏,推理路径只能接着模型自己的输出。

训练路径

-

推理路径

-
前缀仍在正确轨道输入来自错误预测
这个实验没有声称错误一定会无限放大。它只隔离一个事实:训练时的条件分布由真实前缀决定,而自回归推理时的条件分布会受历史预测影响。降低教师强制比例能增加对模型前缀的暴露,但也可能让优化更难,不能只凭一个滑块决定训练方案。