训练集:学习
拟合标准化器、编码器和模型参数。所有会“从数据学出数值”的步骤,都只能在这里学习。
机器学习导论 · 评估可信度实验室
模型评估像一次封闭考试:训练集用于学习,验证集用于排练与选择,测试集只负责最终验收。动手开启下面的风险操作,观察“偷看答案”如何让评估失去可信度。
名称不是重点,职责隔离才是重点。一次样本可以进入哪一段,应在建模流程开始前就确定。
拟合标准化器、编码器和模型参数。所有会“从数据学出数值”的步骤,都只能在这里学习。
比较特征、超参数和候选模型,帮助决定方案;它不应被当成新的训练答案库反复拟合。
方案冻结后才使用,估计模型面对真正未知数据时的表现。看得越多,独立性越弱。
每个开关代表一种流程决策。开启风险后,右侧会说明它破坏了哪一道边界。
选择一个常见预设,观察三段数据如何重新分配。这里假设有 1,000 条彼此可独立切分的样本,仅用于理解比例。
判断原则:比例没有固定答案,代表性和样本量更重要。数据很少时可考虑交叉验证;同一用户、设备或病例的记录应按实体分组;时间序列通常应按时间先后划分,而不是随机打散。
先在心里判断,再展开答案。这里不累计分数,因为真正重要的是说出“预测时刻”和“信息边界”。
是,时间穿越泄漏
实际签收时间在预测之后才出现。线上预测时拿不到它,离线评估却让模型提前看见了结果。
是,预处理泄漏
测试集分布参与了均值计算。应先划分,再只用训练集拟合均值与方差,最后把同一变换应用到验证集和测试集。
通常不是,反而在防泄漏
当同一用户有多条相似记录时,按实体分组能避免模型在测试时认出训练中见过的人。仍需确认部署时面对的是新用户还是老用户。
不是,这是推荐流程
测试集保持独立,直到模型、特征、预处理和阈值全部冻结。若看完测试结果又修改方案,就应准备新的独立测试集重新验收。