交互实验 03 · 排序与校准

排得准,不等于概率说得准

把同一组分数做严格单调的温度变换:样本先后顺序可以不动,0.8 的概率含义却会改变。再挪动目标正类率,看旧校准怎样随分布一起失效。

让分数先“变形”,再对账

固定 144 条预测分数与标签,只改变概率尺度、分箱口径和目标总体权重。温度 T<1 会锐化概率,T>1 会让概率收缩到 0.5 附近。

144 条固定样本 · 基准正类率 37.5%
快速预设
1.00 · 原尺度
使用 sigmoid(logit(p) / T)。只要 T>0,映射就严格单调。
8 箱
等宽分箱。箱越细,局部偏差更清楚,但每箱样本会更少、波动也更大。
0 个百分点 · 目标 37.5%
按类别重加权模拟目标总体变化,模型分数仍沿用旧尺度;总权重标准化为 144。

排序连线:看它们会不会交叉

抽取 10 个分数锚点。左右连线不交叉,说明温度变换没有调换先后。

全量顺序一致 100.0%
ROC-AUC · 排序 全阈值排序能力
PR-AUC(AP)· 排序 会随目标正类率变化
Brier loss · 概率 越低越好
Log loss · 概率 重罚自信但错误的预测

正在计算:排序指标与概率损失会同步更新。

可靠性图:每个概率箱都要对账

横轴是箱内平均预测,纵轴是箱内实际正类频率。蓝线落在对角线上才表示“报多少,就发生多少”;下方直方图提醒你先看每箱有多少证据。

加权 ECE —

每箱明细

空箱也保留,避免图上“消失的区间”被误读成表现很好。

原始 n 是当前概率区间中的固定样本数;目标 N 是按目标正类率重加权后的等效样本量。
概率区间 平均预测 实际频率 绝对差 原始 n / 目标 N

把三个现象分开读

一次调参同时出现多组数字时,先判断是顺序变了、概率尺度变了,还是目标总体变了。

RANK

单调变换保留顺序

温度映射没有交换样本顺序,因此 ROC-AUC 不变。

PROBABILITY

同一排名可以换一套“口气”

概率锐化或软化后,Brier、log loss 与可靠性曲线会移动。

SHIFT

旧概率要在新总体重验

目标正类率不变,当前仍按基准总体对账。

固定教学数据:144 条分数 / 标签;损失与频率按目标总体权重计算。所有计算均在本页本地完成。