异常检测 · 工作点实验

阈值往左一点,真的会让告警系统更好吗?

低阈值能抓到更多异常,也会把更多正常样本送进复核队列。真正要选的不是一条看起来顺眼的分界线,而是漏报、误报和团队处理能力共同允许的工作点。

把阈值放到验证分数上

场景预设
8.2
120
4
300 / 日
0.5%

内置正常 / 异常 log 分数与阈值成本

按每天 10,000 个待评分窗口估算

当前阈值
不考虑容量的最低成本阈值
容量可行区与可行最优

四格表先回答:到底错在了哪里?

预计每日混淆矩阵

当前阈值下,真实异常与真实正常分别被判断为告警或不告警的预计数量
真实情况 预测告警 预测不告警
真实异常 TP · 抓到 FN · 漏报
真实正常 FP · 误报 TN · 放行

Precision、Recall 与 F1

Precision TP / (TP + FP)
Recall TP / (TP + FN)
F1 2PR / (P + R)

改变正类率会改变 Precision 和预计告警量,但在这组固定验证分数上,TPR/Recall 与 FPR 不会随部署基准率改变。

最低成本还要过容量这一关

当前预期错误成本

成本单位 / 日
误报成本 cFP × FP
漏报成本 cFN × FN

C(τ) = cFPFP(τ) + cFNFN(τ)

这里把复核量当成硬容量约束,不另加单条复核成本;若团队要折算人力费用,可再加入 creviewNalert

当前告警量与人工复核容量

预计告警 / 日
团队容量

这里的“最低成本”只是在当前验证分数、正类率与代价假设下计算的工作点。参数应来自真实处置流程;阈值确定后,测试集只做一次独立评估。