把一句话做成 MLM 训练样本

先选目标位,再决定输入端是替换为 [MASK]、随机 token,还是保留原词。不管输入如何变,目标 label 都必须保留原 token。

80% 换 [MASK]10% 换随机词10% 输入保留
总 token0
预测目标0
忽略位置0
损失位置0
位置原 token模型输入label是否计入损失
未选中位置的 label 设为 -100,因此交叉熵只会平均目标位置。