邱宁佳,王晓霞,王 鹏,王艳春
(长春理工大学计算机科学技术学院,长春 130022)
(*通信作者wpeng@cust.edu.cn)
近年来对文本进行情感分析成为了自然语言处理领域的重要分支,进行有效的情感分析能够帮助用户及时掌握所在领域的情绪动态。传统的文本情感分类方法主要为基于情感词典与基于机器学习的方法。在基于情感词典的研究方法上,Araque 等[1]使用语义相似性度量与嵌入式表示结合使用,该模型表明了词汇的选择对跨数据集性能有影响;Zhang等[2]提出了一种基于情感词典的方法,解决了中文文本情感分析问题;Xu 等[3]提出的基于扩展情感词典的方法对评论文本的情感识别具有一定的可行性和准确性。此外,对于情感词典跨数据集的适用性问题,Hung[4]根据上下文信息构建适合领域的情感词典,并将其与偏好向量模型相结合,实现了IMDB和hotels.com 数据集口碑质量分类的显著改进;Khoo 等[5]也提出了新的通用情感词典WKWSCI(Wee Kim Wee School of Communication and Information),将其与常用的五种情感词典进行比较后也取得了不错的分类成绩。在基于机器学习的研究方法上,Singh 等[6]利用了朴素贝叶斯、J48、BFTree 和One Rule(OneR)四种机器学习分类器对IMDB 电影评论数据集进行了实验,对比分析了四种分类器各自的性能;Anggita等[7]使用粒子群优化(Particle Swarm Optimization,PSO)算法优化了朴素贝叶斯和支持向量机(Support Vector Machines,SVM),提高了原算法的分类精度;对产品评论进行情感分类时,Tama 等[8]采用了朴素贝叶斯算法得到了80.48%的分类准确性。基于情感词典的分类过分依赖于构建的情感词典,通用性不强;……