严远亭,吴亚亚,赵姝,张燕平
(安徽大学 计算机科学与技术学院,安徽 合肥 230601)
机器学习、数据挖掘等技术在诸如生物特征识别、文本分类和医学诊断等领域得到了广泛应用[1-6]。近年来,随着传感器技术、信息技术等科学技术的迅猛发展,数据获取的途径日益丰富,这给机器学习等技术带来了极大的发展机遇。然而在实践中,通常会因为存储设备损坏、数据采集设备能力有限等多种因素导致数据出现缺失的情况,我们称其为不完整数据问题。此类问题普遍存在于众多领域中,如:微阵列数据[7-8]、移动电话数据[9]、可视化数据[10]、工业数据[11]、软件项目数据[12]等。然而,传统机器学习的方法往往都是针对完整数据而设计的,因此缺失数据给这些方法带来了极大挑战。
目前已有不少学者针对不完整数据提出了一些解决策略,大致可以分为三类,其一为替代法,即用同一数据集内其他样本的完整部分替代缺失值,有时甚至会将众多缺失属性补以统一的固定值。这种策略虽然简单,但众多研究表明,绝大多数原始数据集的样本属性间都不是相互独立的,因此单一的替换策略直接忽略了属性间的关系,并不可取;其二为删除法,例如在许多统计软件如:SPSS、SAS 中,默认采用Listwise deletion(LD)策略处理缺失值,直接删除带有缺失项的样本。然而,这种策略是以减少原始数据为代价换取数据完整,在信息获取代价较大时会造成严重的资源浪费和重要信息的损失。因此,解决不完整数据问题的第3 种策略,即在多数现有的机器学习算法被应用到实际问题之前,将缺失数据填充完整的策略更为主流一些。……