吴锦华,万家山,伍 祥
(安徽信息工程学院 计算机与软件工程学院,安徽 芜湖241000)
在机器学习和模式识别领域,传统的学习算法在处理高维数据(如生物特征数据、基因数据、股票交易数据等)时,经常会遭遇到“维数灾难”问题[1]。为解决这一问题,目前主要有两类方法:一类是偏向于高维数据的有效表示,如特征选择、特征提取、稀疏表示等传统数据降维算法;另一类是偏向于构建学习模型,如分类回归模型、聚类模型等,最终的学习模型用于数据的预测和分析。笔者通过提出特征选择方法构建分类回归学习模型,并分析最终的分类性能来检验所提方法的有效性。
近些年来,特征选择方法得到了很多研究人员的关注,旨在从高维数据中提取出有效表示形式,从而为目标学习模型提供帮助。目前特征选择方法主要有Laplacian Score(LS)[2]、递归特征消除法(RFE)[3]、顺序向前移动选择(SFFS)[4]、Fisher Score(FS)[5]、Lasso[6]等,在这些特征选择算法当中,基于稀疏表示的特征选择方法得到了广泛关注和研究,如Lasso 方法模型中,引入的稀疏项保证有价值的特征能被选择,并且Lasso 方法模型同时进行回归分析。然而,该方法在处理高维数据时计算速度比较慢,Tibshirani R 等人[7]在Lasso 方法模型的基础上进行了改进,提出的Fussed Lasso 方法能够对计算速度优化。除此之外,Jie 等人[8]为了解决多模态分类中的问题,利用Lasso 方法模型的稀疏项,并引入正则化项,提出一种基于流形正则化的多任务特征选择方法(M2TFS)。吴锦华等人[9]在Lasso 模型的基础上,引入判别性正则化项,提出新颖的判别性特征选择方法。……