把 30 个特征压缩成 4 个成分,图上看起来很清爽,但分类模型可能因此丢掉关键的判别信息。反过来,保留更多方差也不保证预测更好。降维前应先明确目的:是减少计算、处理稀疏矩阵、得到可解释的非负成分,还是改善下游预测。本文在一组可复现的非负模拟数据上,比较不降维的逻辑回归基线与 PCA、TruncatedSVD、NMF 的不同组件数。所有预处理与降维器都放入交叉验证的Pipeline内。实验数值仅反映这组模拟数据;不把三种方法的“信息保留”指标混成同一把尺子。文章目录高维特征为什么需要降维根据数据形态选择 PCA、TruncatedSVD 或 NMF组件数应该依据什么确定同时比较信息保留和下游预测效果降维失效时如何检查数据与流程总结高维特征为什么需要降维维度增加可能带来训练和存储成本、特征间冗余,以及在样本有限时更不稳定的估计。但如果原始特征已经有效,降维也可能让分类器失去少量却很关键的信号。因此先建立不降维基线,再决定是否值得压缩。目标应记录的基线不能忽略的代价降低训练或推理成本原始特征下的交叉验证得分和耗时降维器本身也需要拟合、变换和保存。改善泛化相同划分、相同下游模型的得分组件数不能在完整数据或测试集上挑选。增强解释性业务能够理解的原始变量关系主要成分、非负成分与业务语义不是天然对应。根据数据形态选择 PCA、TruncatedSVD 或 NMFPCA 先围绕训练数据的均值寻找最大方差方向;TruncatedSVD 不要求在变换前中心化,常用于稀疏文本计数或词频矩阵;NMF 要求输入非负,寻找加性成分。本例的模拟特征为非负稠密矩阵,因此三者都能运行,但“都能运行”不等于“优化的是同一个目标”。方法定义可见
阅读完成 · 觉得有帮助?