先设候选范围,再看四条曲线
切换数据形状、噪声和种子会重新生成同规模样本。每个 K 使用多次独立初始化;稳定性取不同重启划分的两两 ARI 平均,因此不受簇编号交换影响。
同时增加团内抖动与少量均匀噪声。
例如团队最多维护 5 套差异化策略。
96 个样本 · K=2…10 · 每个 K 进行 6 次独立重启
已计算
查看某个 K
点一个 K,看看这次划分长什么样
示意图使用当前 K 下惯性最小的一次重启。颜色与点形共同区分簇;右侧把四项证据翻译成同一组可核对的判断。
K=4 的聚类示意
为什么不能只看一个指标
四条证据没有共同的“最高分”。它们回答的是不同问题,也各自有看不到的部分。
| 证据 | 它回答什么 | 它不能单独证明什么 |
|---|---|---|
| 惯性肘部 | 继续增加 K,簇内平方和的边际改善是否明显变小 | 平滑下降时不一定有清楚肘部;惯性最小也不等于最有用 |
| 轮廓系数 | 指定距离下,样本是否更贴近本簇而远离邻簇 | 它偏爱紧凑凸簇,可能低估月牙等非球形结构 |
| 重启稳定性 | 换初始化后,划分是否仍能复现 | 稳定的划分也可能没有业务含义或下游价值 |
| 最小簇与行动上限 | 每组是否有足够样本,团队是否能维护相应动作 | 可运营不代表数据中存在唯一、天然的类别 |
我会先排除超出行动上限或产生过小簇的候选,再比较肘部、轮廓和稳定性。如果这些证据互相冲突,就保留冲突,而不是硬凑一个“标准答案”。