(广西大学计算机与电子信息学院,广西南宁 530004)
微博是基于互联网的应用,在其上发布和浏览信息具有低成本、便捷和及时等特征,随着互联网的蓬勃发展,微博逐渐发展成为主流社交平台之一。目前,微博拥有大量的活跃用户,这些用户随时随地发布或更新他们的状态、感悟和评论等信息。这些信息涉及面广,蕴含了大量价值。对微博文本进行情感倾向分析是当前微博数据挖掘研究的热点内容之一。挖掘微博文本情感倾向可得到用户对产品的喜爱程度[1]、政策支持度[2]、热点话题倾向[3]和立场[4]等相关信息,对产品生产和销售改进、政策研究及民众热点立场把握等问题都有重要参考价值。
文本情感倾向分析属于自然语言研究范畴,自然语言描述观点的多样性是影响文本情感倾向分析精度的主要因素之一。与新闻、论坛和贴吧等具备良好内容分类的媒体相比,微博内容宽泛,分类性差。当前,文本情感分析主要有基于情感词典和基于机器学习两种方法,均是在对文本进行分词的基础上通过某种算法进行文本情感极性计算。大量研究结果表明,这两种研究方法进行情感分析的精度均受到文本内容领域相关度的制约。由于同一词语在不同语境中可能表现出不同的情感极性,因此不区分词语语境对微博文本进行情感分析使得其精度难以保证。采用LDA 扩展模型是当前文本情感分析重要方法之一,但该方法的当前研究未能考虑同一词语在不同语境下情感极性差异及非特征情感词对微博文本情感极性的影响,若能将此二者加以考虑,则基于LDA 扩展模型的文本情感分析精度将得到进一步提升。……