基于LDA模型的文本聚类检索

2018-06-28 02:55:20李霄野李春生张可佳
计算机与现代化 2018年6期
关键词:文本评价方法

李霄野,李春生,李 龙,张可佳

(东北石油大学计算机与信息技术学院,黑龙江 大庆 163318)

0 引 言

信息化媒体的迅速发展使得网络上存在大量的新闻数据,如何从这些数据中检索到用户需要的信息成了当今研究的热点内容。计算机对于中文的处理比对于西文的处理存在更大的难度,集中体现在对文本分类的处理上。在这种背景下,利用聚类分析技术对文本数据进行简化处理,对检索出的结果进行重新组织,加快信息检索速度,实现信息的个性化推送都是一系列极具发展前景的应用。文本聚类是一种无监督的、不需要训练过程的、不需要预先对文档手工标注类别的机器学习方法。这种方法具有一定的灵活性且有较强的自动化处理能力,具体体现在其能够将无结构的自然语言文本转化成可供计算机计算的特征文本,现已成为一种处理文本信息的重要手段,被越来越多的研究人员关注[1]。相似度计算是文本聚类中非常重要的一个步骤,以往在判断2个文档的相似度时,通常是根据查看2篇文档中共同包含单词的数量多少,例如TF-IDF(Term Frequency-Inverse Document Frequency)模型,但是可能存在2个文档之间几乎没有相同的词,而2个文档的语义相似,这种方法没有考虑文字背后的语义关联,导致检索系统对用户的查询需求有偏差,返回的结果不够全面[2]。所以在判断文档相似性时需要挖掘出文档的语义,而语义挖掘的关键在于选取合适的主题模型,LDA(Latent Dirichlet Allocation,潜在狄利克雷分配模型)就是其中一种比较有效的潜在语义模型。……

登录APP查看全文

猜你喜欢
文本评价方法
SBR改性沥青的稳定性评价
石油沥青(2021年4期)2021-10-14 08:50:44
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
用对方法才能瘦
Coco薇(2016年2期)2016-03-22 02:42:52
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
Coco薇(2015年1期)2015-08-13 02:47:34
捕鱼
基于Moodle的学习评价
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13
保加利亚转轨20年评价