聚类实验 02 · 尺度与距离

同一批点,谁才算“最近”?

点的位置没有变,换一把“尺子”,最近邻和聚类边界就可能一起改写。选择一个查询样本,再调节缩放方式、特征系数与距离,看人的判断是怎样进入几何空间的。

相似性 = 特征变换 × 显式权重 × 距离定义

先改“尺子”,再看邻居

图上的位置始终按原始单位绘制;背景色和虚线则按当前度量重新计算。点击任意圆点把它设为查询样本,键盘用户可用 Tab 聚焦后按 Enter 或空格选择。

订阅用户 · 年消费额与月访问

原始量纲:直接比较加权后的原始差异。

原始量纲 · 欧氏 L₂
样本、固定质心与一次最近中心分配边界 圆点是可选择的样本,菱形是三个固定质心,背景颜色显示当前缩放和距离下的一次最近中心分配区域。
簇 A 簇 B 簇 C 固定质心
原始坐标不动;度量边界随参数重画

把“最近”拆成两项差异

排序表使用变换后的距离。选择任一邻居,可查看两个特征分别贡献了多少;这比只盯着一个总距离更容易发现哪个特征正在主导判断。

最近邻顺序

查询:U4 知夏

距离分解

欧氏 L₂

一次分配,边界立刻重画

三个菱形质心保持不动,每个样本只执行一次“选择当前最近质心”。因此下面展示的是分配步骤,不包含把质心更新到成员中心的下一步。

欧氏距离对应标准 K-means 的分配几何。若改用曼哈顿距离,这里只是在比较一次最近中心分配;完整迭代应相应改用中位数型中心(k-medians),不能仍把“更新到均值”原样照搬。


缩放属于建模假设,不是清洗尾声

01 · 原始量纲

单位会暗中投票

“元”的数值跨度远大于“次”时,未缩放距离几乎等于按金额排序。算法并不知道单位为何不同。

02 · 标准与稳健

分母也表达判断

标准差反映整体波动,IQR 更少受极端值牵动。两种处理会定义不同的“一个典型差异”。

03 · 上线复用

只在拟合样本上估计

均值、标准差、中位数和 IQR 应从训练样本得到,并原样用于未来数据,避免让未来分布参与建模。

“先标准化再聚类”不是免思考的配方。它只是把假设写得更显眼:每个特征一个标准差是否真的同等重要,仍要回到任务与业务后果中回答。