李霄野,李春生,李 龙,张可佳
(东北石油大学计算机与信息技术学院,黑龙江 大庆 163318)
信息化媒体的迅速发展使得网络上存在大量的新闻数据,如何从这些数据中检索到用户需要的信息成了当今研究的热点内容。计算机对于中文的处理比对于西文的处理存在更大的难度,集中体现在对文本分类的处理上。在这种背景下,利用聚类分析技术对文本数据进行简化处理,对检索出的结果进行重新组织,加快信息检索速度,实现信息的个性化推送都是一系列极具发展前景的应用。文本聚类是一种无监督的、不需要训练过程的、不需要预先对文档手工标注类别的机器学习方法。这种方法具有一定的灵活性且有较强的自动化处理能力,具体体现在其能够将无结构的自然语言文本转化成可供计算机计算的特征文本,现已成为一种处理文本信息的重要手段,被越来越多的研究人员关注[1]。相似度计算是文本聚类中非常重要的一个步骤,以往在判断2个文档的相似度时,通常是根据查看2篇文档中共同包含单词的数量多少,例如TF-IDF(Term Frequency-Inverse Document Frequency)模型,但是可能存在2个文档之间几乎没有相同的词,而2个文档的语义相似,这种方法没有考虑文字背后的语义关联,导致检索系统对用户的查询需求有偏差,返回的结果不够全面[2]。所以在判断文档相似性时需要挖掘出文档的语义,而语义挖掘的关键在于选取合适的主题模型,LDA(Latent Dirichlet Allocation,潜在狄利克雷分配模型)就是其中一种比较有效的潜在语义模型。……