机器学习导论 · 评估可信度实验室

好看的分数,真的可信吗?

模型评估像一次封闭考试:训练集用于学习,验证集用于排练与选择,测试集只负责最终验收。动手开启下面的风险操作,观察“偷看答案”如何让评估失去可信度。

三段数据,各守一道门

名称不是重点,职责隔离才是重点。一次样本可以进入哪一段,应在建模流程开始前就确定。

训练集:学习

拟合标准化器、编码器和模型参数。所有会“从数据学出数值”的步骤,都只能在这里学习。

验证集:选择

比较特征、超参数和候选模型,帮助决定方案;它不应被当成新的训练答案库反复拟合。

测试集:验收

方案冻结后才使用,估计模型面对真正未知数据时的表现。看得越多,独立性越弱。

安全基线流程
  1. 先划分数据
  2. 只在训练集拟合
    预处理与模型
  3. 用验证集
    选择方案
  4. 冻结方案
  5. 测试集
    最终验收

动手制造一次“虚假优秀”

每个开关代表一种流程决策。开启风险后,右侧会说明它破坏了哪一道边界。

比例试验:不是越整齐越科学

选择一个常见预设,观察三段数据如何重新分配。这里假设有 1,000 条彼此可独立切分的样本,仅用于理解比例。

训练集70% · 700 条
验证集15% · 150 条
测试集15% · 150 条

当前 70/15/15:给训练保留较多样本,同时留出两份独立数据用于选择和验收。

判断原则:比例没有固定答案,代表性和样本量更重要。数据很少时可考虑交叉验证;同一用户、设备或病例的记录应按实体分组;时间序列通常应按时间先后划分,而不是随机打散。

快速辨析:这算泄漏吗?

先在心里判断,再展开答案。这里不累计分数,因为真正重要的是说出“预测时刻”和“信息边界”。