陈国民
(海军潜艇学院,山东 青岛 266071)
Bootstrap法是以原始数据为基础的模拟抽样统计推断法,用于研究原始数据的某统计量的分布特征,广泛应用于可信区间估计、假设检验等问题。当用Bootstrap法进行统计分析时,需要从原样本(样本含量记为n)中随机有放回地抽取n*个观测单位,构成Bootstrap样本。关于Bootstrap样本含量n*的大小,一般认为,可以小于,等于或者大于原样本含量n[1]。但从有关Bootstrap法的文献来看,往往把Bootstrap样本含量n*设置为与原样本含量n相等[2]-[4]。本文拟运用计算机模拟方法考察Bootstrap样本含量n*对Bootstrap法总体中位数可信区间估计效果的影响,从而探讨Bootstrap样本含量n*的设置方法。
用VFP编写程序进行统计模拟研究。
模拟步骤:
(1)模拟从标准正态分布总体X~N(0,1)中随机抽取一个样本,样本含量为n。
(2)从该样本中随机有放回抽取一个Bootstrap样本,Bootstrap样本含量为n*。
(3)计算获得的Bootstrap样本的中位数。
(4)重复步骤(2)~(3)B次(B=1000)。
(5)对求得的B个中位数按升序排序,找到2.5%(第25位)和97.5%(第975位)百分位数,即为由该样本估计的总体中位数的95%可信区间。
(6)判断求得的95%可信区间是否包含总体中位数0,如果包含0,则记正确1次;否则记错误1次。
(7)重复步骤(1)~(6)1000次,得到1000个可信区间。
(8)统计1000个Bootstrap可信区间包含总体中位数0的百分比,该百分比即为Bootstrap法总体中位数可信区间估计正确率的估计值。
参数设置:
模拟实验一:原样本含量n分别设置为5,10,50,100;Bootstrap样本含量n*分别设置为2,5,10,20,30,40,50,100,200。
模拟实验二:原样本含量n分别设置为2~50,100;Bootstrap样本含量n*分别设置为n,n-1,n-2,n-3,n-4。
判断标准:正确率越接近准确度100(1-α)%越好。本文α=0.05,所以,1000次模拟所得的正确率越接近95%越好。……