宿 晨,徐 华,崔 鑫,王玲娣
(江南大学 物联网工程学院,江苏 无锡 214122)
分类问题是数据挖掘中的难点。绝大多数分类算法只是在平衡数据集分类效果显著,而在不均衡数据集上分类效果欠佳。但现实生活中的分类问题往往是类别不均衡的,例如银行欺诈的检测、垃圾邮件的检测、车辆识别、疾病诊断等。不均衡数据分类问题已经成为机器学习、数据挖掘等领域的重要研究方向之一[1-2]。在实际的生活中,不均衡分类问题大多数是多分类问题,因此更具有研究意义。而多数类的不均衡分类问题与二分类的分类问题相比,多数类对于分类模型要求更高,获取少数类的代价也更大,类间数据的分布也更多样化,也更难被分类。针对不均衡数据分类的研究主要集中在数据层面与算法层面的改进研究。数据层面的改进主要集中在对数据集的改进,增加少数类数据或减少多数类数据,使得原本的数据集相对均衡,主要的改进方法是过采样与欠采样。早期,Chawla等[3-4],提出了一种SMOTEBoost(synthetic minority over-sampling technique and boost)的方法,将SMOTE采样算法与集成算法Boost相结合,加强了对小类样本的关注度;武森等[5]将聚类算法运用到采样中,先利用聚类欠采样方法将数据集均衡化,然后利用AdaBoost算法对新生成的数据集进行分类操作;2013年,Krawczyk 等[6]使用 PUSBE(pruned under-sampling balanced ensemble)方法,该方法有效运用了特征选择技术;2014 年,Krawczyk等[7]又提出了 CS-MCS(cost-sensitive multiple classifier systems)集成方法,运用随机欠采样结合遗传算法相结合的方式。在低维数据集上效果明显,但是高维数据集上效果欠佳。……