先切换目标,再看四条证据
每条曲线都回答一个不同问题。累计方差与重建误差来自同一份谱;存储比例把均值、主轴和样本得分一起计入;下游分数模拟训练折内验证,不能用测试集反复挑 k。
各方向叠加相同噪声底,使谱更平、更难压缩。
它是你写下的约束,不是 PCA 自动给出的真理。
800 个样本 · 12 个原始特征 · k=1…8
达到 95%:k=5
查看某个 k
点一个 k,把收益与代价对齐
建议只在当前数据谱、噪声、阈值和用途下成立。相邻 k 的结果接近时,成本更低的方案通常更容易解释和复现。
按用途给出的复核建议
95% 不是普适规则,任务才是验收标准
累计方差只描述当前预处理空间里的无监督变化。它没有读取存储预算、展示维数限制,也没有读取标签。
| 用途 | 先写下什么约束 | 怎样选择与验收 |
|---|---|---|
| 压缩与传输 | 字节、时延或可接受重建误差 | 选择满足约束的最小 k,并在原单位检查关键样本误差 |
| 二维 / 三维可视化 | 可读维数与需要观察的关系 | 报告两三轴累计方差,并用替代视角和原空间证据复核 |
| 下游建模 | 训练折内验证指标、时延与模型大小 | 把 k 放进 Pipeline 搜索;测试集只做一次最终评估 |
如果 k=5 与 k=6 的验证分数几乎一样,我们不必假装 6 是唯一正确答案。记录可接受区间,再选成本更低、结果更稳定的一端。