,
共现分析是对两个及以上能够表达某一学科领域研究主题或方向的特征项(如主题词、引文、作者等)在同一篇文献中出现的现象进行分析。出现的频次越多,表明这些特征项的关系越密切、距离越近[1]。作为内容分析的常用方法之一,共现分析常与SPSS中的系统聚类分析结合使用[2]。但目前对原始矩阵、相似性度量和类间距离计算方法[3]的选择尚存在争议。
原始矩阵的类型可选择共现矩阵或特征项-来源文献矩阵。共现矩阵是对称矩阵的行列均是特征项,单元格的数字则是行特征项和对应列特征项共同出现的次数;特征项-来源文献矩阵,其行列分别为特征项及其来源文献,若特征项在文献中出现则值为1,否则为0。相似性度量是矩阵标准化的手段,通过度量使得相似者愈加相似,不相似者愈加不相似,用以衡量个体之间的距离。而类间距离计算方法可衡量类与类之间的距离,距离最小的两个小类被合并成为一类。SPSS 提供的类间距离测度方法有组间(内)连接、最大(小)距离和离差平方和法(简称Ward法)等。有研究表明,国内学者应用共现分析的方法存在问题[4]。笔者调研发现,国内学者进行文献聚类共现分析应用最广泛的是共现矩阵。共现矩阵转化为相关矩阵的过程中,最常用的相似系数是ochiai系数,最受欢迎的聚类方法是类间计算方法选择Ward和组间连接法,度量方法为平方欧式距离。词篇矩阵大多选用ochiai系数,聚类方法选择组间或组内联接法。……