赵玮
(北京联合大学 应用科技学院, 北京 100101)

采用机器学习的聚类模型特征选择方法比较
赵玮
(北京联合大学 应用科技学院, 北京 100101)
针对机器学习聚类模型在特征选择时存在的问题,首先,对特征选择在聚类模型中的适用性进行分析并对其进行调整和改进.然后,基于R语言中的递归特征消除(RFE)特征选择方法和Boruta特征选择方法进行特征选择算法设计.最后,应用聚类内部有效性指标,对在线品牌忠诚度聚类模型优化结果进行分析,进而对特征选择方法进行比较研究.结果表明:Boruta特征选择方法更具优势. 关键词: 特征选择; 聚类模型; 机器学习; 递归特征消除算法; Boruta方法
特征选择对基于机器学习的模型构建和优化有着重要意义.优质特征的选择和构建可以选择有限合理的特征,剔除不相关的特征,让模型得到数据集中良好的结构,使模型运算速度更快,模型结果更易理解,模型更易维护.因此,使模型发挥优良效果,需要通过特征选择的方法对模型进行优化.然而,基于机器学习的聚类模型进行特征选择存在以下2个问题.1) 特征选择方法通常是针对机器学习中的监督学习模型,需要具备目标特征变量,而聚类模型属于无监督学习[1-2],没有目标特征变量.2) R语言作为机器学习比较好的实践环境,提供了相应的特征选择包,但需要做比较分析.本文对特征选择在聚类模型中的适用性进行分析,应用R语言进行特征选择算法设计.