方博平 郭佳怡 陆欣怡 王梦怡 宋涛




摘要:对智慧政务平台的群众舆情建立了文本聚类模型进行信息挖掘与分析。基于FastText原理利用Python语言进行数据预处理并实现文本数据的分类。使用TF-IDF算法将文本信息转换为权重向量并提取文本关键词,结合K-means聚类算法建立文本聚类模型,实现对群众舆情中高频热点问题的挖掘和排序。最后,对政府反馈意见以信息量、可解释性、相关性3个评价指标进行权重计算,构建了广义线性回归模型的评价指标体系。每一步骤均给出了相应实例分析及计算结果。
关键词:智慧政务;FastText;TF-IDF算法;K-means聚类;广义线性回归模型
在互联网的快速发展和渗透下,网络问政平台为收集海量群众舆情文本数据提供了方便。但如何快速处理大量留言文本数据并进行有效处理成为亟待解决的问题。
本文利用收集自互联网公开来源的群众问政留言记录,及相关部门对部分群众留言的答复意见,采用FastText原理对留言詳情信息进行分类,用TF-IDF算法计算权重,提取文本关键词,结合K-means算法提取热点话题,计算余弦相似度筛选高质量答复建议,构建答复意见质量评价指标体系的广义线性回归模型。
1预处理工作
数据来源为互联网公开渠道。基于Python语言,预处理选择中文分词模块jieba对群众留言进行分词,采用精确模式用于去除文本标注的无效信息,为后续进一步处理作准备。
建立停用词字典,选择了CSDN网站的停用词表,其中包含1893个停用词。在分词以后去停用词。……