聚类实验 03 · K 的选择

K 越大越好吗?先把四条证据放在一起

惯性会随着 K 增大一路下降,所以“取最小惯性”只会把我们推向测试范围的最右端。真正的选择要同时看边际收益、分离程度、重启后能否复现,以及最小一簇是否还能被解释和行动。

先写业务可行动上限,再在可行范围里比较;必要时,“不发布分群”也是结论。

先设候选范围,再看四条曲线

切换数据形状、噪声和种子会重新生成同规模样本。每个 K 使用多次独立初始化;稳定性取不同重启划分的两两 ARI 平均,因此不受簇编号交换影响。

快速预设

同时增加团内抖动与少量均匀噪声。

例如团队最多维护 5 套差异化策略。

96 个样本 · K=2…10 · 每个 K 进行 6 次独立重启

已计算
查看某个 K

点一个 K,看看这次划分长什么样

示意图使用当前 K 下惯性最小的一次重启。颜色与点形共同区分簇;右侧把四项证据翻译成同一组可核对的判断。

K=4 的聚类示意

96 个样本 · 4 个非空簇
当前数据在所选 K 下的二维 K-means 聚类结果。

    为什么不能只看一个指标

    四条证据没有共同的“最高分”。它们回答的是不同问题,也各自有看不到的部分。

    证据它回答什么它不能单独证明什么
    惯性肘部继续增加 K,簇内平方和的边际改善是否明显变小平滑下降时不一定有清楚肘部;惯性最小也不等于最有用
    轮廓系数指定距离下,样本是否更贴近本簇而远离邻簇它偏爱紧凑凸簇,可能低估月牙等非球形结构
    重启稳定性换初始化后,划分是否仍能复现稳定的划分也可能没有业务含义或下游价值
    最小簇与行动上限每组是否有足够样本,团队是否能维护相应动作可运营不代表数据中存在唯一、天然的类别

    我会先排除超出行动上限或产生过小簇的候选,再比较肘部、轮廓和稳定性。如果这些证据互相冲突,就保留冲突,而不是硬凑一个“标准答案”。