唐荣,罗川,曹潜,王思朝
(四川大学 计算机学院,四川 成都 610065)
特征选择的目标是在给定评价标准下选择非冗余的特征子集,其作为一项重要的数据预处理步骤,能够有效地提高数据分析模型的准确性和高效性,在数据挖掘与知识发现中起着重要的作用[1]。
数据中存在一些缺失值是一种非常普遍的现象,缺失值给数据中的分类知识带来了不一致性问题[2]。粗糙集理论是一种能够有效应对不精确、不一致信息的数据建模与知识获取工具。近年来,人们基于粗糙集理论针对不完备数据的特征选择问题进行了深入的分析和讨论。Kryszkiewicz[3]认为不完备数据中缺失值应是已有值域中的某一特征值,进而提出了一种基于广义差别矩阵的特征选择方法。Parthalin等[4]为了保留分类所产生的不一致决策区域,研究了基于容差粗糙集的特征选择方法。Meng等[5]讨论了不一致不完备决策系统中基于区分矩阵的特征选择方法。Grzymala-Busse等[6]将缺失值考虑为丢失值和不在乎值,提出了基于广义特征关系粗糙集模型的特征选择方法。Qian等[7]提出了一种高效的正向近似加速器,用于加速不完备数据特征选择的启发式特征搜索过程。Dai[8]为了处理不完备数值型数据,建立了一种新的容差模糊粗糙集模型,并提出了基于差别矩阵的特征选择方法。Yang等[9]定义了多准则决策系统中相似优势关系的概念,提出了4种基于差别矩阵的近似分布约简方法。Liang等[10]提出了一种不完备信息系统中基于粗糙熵的启发式特征选择算法。……