束搜索与长度偏置实验台

固定同一棵小概率树,改变 beam 宽度与长度归一化指数。逐步扩展可以看到:局部最优不等于序列最优,扩大 beam 也不是免费午餐。

当前步:0评分:log P / 长度α等待扩展
点击“扩展一步”开始搜索。
贪心路径(beam=1)“很” · P=0.275第一步选中“很”后,很快选择结束。
保留两个候选“天气 很好” · P=0.324第一步暂居第二,完整序列概率反而更高。
原始对数概率会不断累加负数,较短序列天然少付几步代价。长度归一化能改变排序,但 α 需要在开发集上调节;过强归一化也可能偏爱冗长输出。覆盖惩罚解决的是“源内容有没有被照顾”,不是同一个旋钮。