来 鹏,孙 鑫,高羽飞,赵英序
(南京信息工程大学 数学与统计学院,南京 210044)
随着网络与通信技术的飞速发展,人们常会遇到各种超高维复杂数据问题,如证券市场的交易数据、X射线断层摄影数据、生物基因表达数据、文档词频数据等。在分析超高维数据问题时,最大的难点是随着维数的膨胀,分析和处理数据的复杂度、成本以及所需的空间样本数都将呈指数级增长。传统的多元统计方法在处理超高维数据问题时会遇到如计算效率无法满足、计算存储空间需求变高、传统统计指标不再适用、方法的假设条件不再满足等困难,所以构建适用于超高维数据的新统计方法是很有必要的。
特征筛选是目前最常见的处理超高维数据问题的手段之一,一般遵循“两步走”的筛选过程:第一步在稀疏性假设下对超高维数据进行大规模粗略的变量筛选,将超高维数据降到一个小得多的低维空间中;第二步再用传统的统计方法进行建模分析。由此可见,初步特征筛选的准确降维直接影响到后续建模。Fan和Lv[1]、Fan等[2]、Fan和Song[3]、Fan等[4]、Liu等[5]在参数或半参数模型下提出了多种特征筛选方法。然而在超高维数据分析过程中,想要找到合适的模型是很困难的,因此,Li等[6]、He等[7]、Mai和Zou[8]提出了无模型下基于多种统计度量指标的特征筛选方法。
在超高维数据分析中,有一类特殊的超高维数据类型,其响应变量和协变量都为分类变量。对于该类问题,Huang等[9]提出了超高维分类数据的特征筛选方法Pearson卡方检验算法(PC-SIS),对超高维数据,利用χ2统计量检验协变量与响应变量是否具有显著的相关关系,即对指标进行排序。……