先改“尺子”,再看邻居
图上的位置始终按原始单位绘制;背景色和虚线则按当前度量重新计算。点击任意圆点把它设为查询样本,键盘用户可用 Tab 聚焦后按 Enter 或空格选择。
订阅用户 · 年消费额与月访问
原始量纲 · 欧氏 L₂
原始量纲:直接比较加权后的原始差异。
簇 A
簇 B
簇 C
固定质心
原始坐标不动;度量边界随参数重画
把“最近”拆成两项差异
排序表使用变换后的距离。选择任一邻居,可查看两个特征分别贡献了多少;这比只盯着一个总距离更容易发现哪个特征正在主导判断。
距离分解
欧氏 L₂一次分配,边界立刻重画
三个菱形质心保持不动,每个样本只执行一次“选择当前最近质心”。因此下面展示的是分配步骤,不包含把质心更新到成员中心的下一步。
欧氏距离对应标准 K-means 的分配几何。若改用曼哈顿距离,这里只是在比较一次最近中心分配;完整迭代应相应改用中位数型中心(k-medians),不能仍把“更新到均值”原样照搬。
缩放属于建模假设,不是清洗尾声
单位会暗中投票
“元”的数值跨度远大于“次”时,未缩放距离几乎等于按金额排序。算法并不知道单位为何不同。
分母也表达判断
标准差反映整体波动,IQR 更少受极端值牵动。两种处理会定义不同的“一个典型差异”。
只在拟合样本上估计
均值、标准差、中位数和 IQR 应从训练样本得到,并原样用于未来数据,避免让未来分布参与建模。
“先标准化再聚类”不是免思考的配方。它只是把假设写得更显眼:每个特征一个标准差是否真的同等重要,仍要回到任务与业务后果中回答。