基于频繁词网络的LDA最优主题个数选取方法

2018-08-21 02:06:52李菲菲王移芝
计算机技术与发展 2018年8期
关键词:文本方法模型

李菲菲,王移芝

(北京交通大学 计算机与信息技术学院,北京 100044)

0 引 言

随着移动互联网的快速发展,网络信息量特别是文本信息呈指数增长,因此如何精准有效地挖掘、组织和利用海量文本背后的有用信息成为一个热门话题。文本聚类技术作为自然语言处理(natural language processing,NLP)的预处理步骤,对文本进一步分析和处理有着重要影响,比如信息检索、生成文档摘要等,在文本聚类方面,主题聚类[1]方法比传统方法更有效。于是,隐含狄利克雷分布(latent Dirichlet allocation,LDA)在挖掘文档中的隐含主题方面得到了越来越多的应用。

LDA[2]主题模型在2003年由普林斯顿大学的David M.Blei等提出,该模型是一种文本建模方法,能够将每篇文档的主题以概率分布的形式给出,用来识别大规模文本或者视频中隐含的主题信息,在信息检索、文本分类等领域应用非常广泛。目前普遍认为应用基于吉布斯采样[3]的LDA的最大问题是无法确定最优主题数目,然而主题数目的选取直接影响到LDA主题模型的性能,导致文档分布表示存在精度误差。

在大规模语料库中,文档集的聚类簇数通常与句子集中隐藏的主题数目一致,前者作为后者的先验知识。根据频繁词网络[4]隐含社区个数与文档集隐含主题数相一致的特点,文中提出了一种以频繁词集网络的社区划分个数用来指定LDA主题模型主题输入个数的方法,使得指定主题数更加接近文档分布表征的隐含主题数目。

1 相关工作

1.1 研究现状

大量研究表明,LDA主题抽取效果[5]与潜在主题的数量直接相关,主题抽取的结果对主题数目非常敏感。……

登录APP查看全文

猜你喜欢
文本方法模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
3D打印中的模型分割与打包
用对方法才能瘦
Coco薇(2016年2期)2016-03-22 02:42:52
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
四大方法 教你不再“坐以待病”!
Coco薇(2015年1期)2015-08-13 02:47:34
捕鱼
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13