高云龙 罗斯哲 潘金艳 陈柏华 张逸松
随着技术的进步,数据采集的效率逐渐提高,使得数据的规模越来越大、复杂性越来越高.在大多数情况下,这些高维数据都存在着能够保留大部分有效信息的低维子空间,如何移除高维空间中的噪声和无关信息,提高后续学习算法的性能和效率一直是模式识别和机器学习领域的研究热点.在过去的几十年中涌现出了许多优秀的算法,PCA[1]是其中最经典的方法之一,它通过线性变换把数据投影到一个新的坐标空间中,希望用较少的变量来表示原数据所提供的大部分信息.PCA逐渐发展为多种应用的预处理技术方法,如图像识别、生物信息和数据挖掘[2−4].由于其用途广泛且原理简单,研究者们陆续提出了各种改进的PCA算法.Koren等[5]提出的WPCA使用了加权距离来减轻离群点对投影方向的影响,突出了与主成分相关的特征;Schlkopf等[6]通过非线性映射将原始数据映射到高维特征空间,再执行kernel-PCA以提取特征;李春娜等[7]极大化带有稀疏正则项的Lp模样本方差,同时赋予算法鲁棒性和稀疏性.
衡量算法的优劣,一个重要的指标就是鲁棒性,尽管基于L2模的PCA能够解决许多问题,但并不能有效地处理小样本问题中的离群点[8],因为L2模的非线性变化特征会放大离群点所带来的影响,使算法倾向于保留外围结构.为了减轻异常点的负面影响,目前已经提出了各种增强鲁棒性的解决方案.L1模被认为是增强算法鲁棒性的……