王汝娇,姬东鸿
(武汉大学 计算机学院,武汉 430072)
随着移动互联网和社交网络应用的飞速发展,用户越来越乐于利用微博、微信、Twitter、Facebook等社交软件在互联网中分享和传播自己对于某件事物的立场和看法,或者在各大电商、APP应用等平台中表达对某一产品或者服务的使用感受。如何准确高效地对这类带有感情色彩的文本进行分析处理、归纳推理已成为当前学界和商界的迫切需求,这就大大地促进了文本情感分析技术的发展[1]。
文本情感分析依据其处理的文本粒度不同可以分为:文档级,句子级,词语级。文档级情感分析目的是对文档表达的整体情感倾向进行判别分类,通常重点关注话题和与话题相关的观点词和情感词。句子级情感分析是一个三元分类问题,其重点在于判断句子是否为主观句,并在此基础上判别主观句的情感倾向是正面、负面或中立。词语级情感分析主要包括基于词典的情感分类方法和基于语料的情感分析方法,前者通过同义、反义以及语义层次来构建情感词,而后者通常人工初始少量情感词作为种子,然后通过某种统计方法或者句式分析方法在大规模语料数据中判别其他词语的情感倾向性。
对Twitter短文本开展情感分析研究,通过判断Twitter文本作者的情感状态是积极的肯定赞赏、中立观望或者消极的否定批判,获取Twitter舆论话题的倾向性,把握舆论的走向。但是,Twitter短文本区别于传统文本,其长度通常只有1个~100个词左右,Twitter中包含的信息总量虽然庞大,但是单条Twitter短文本包含的特征少,并且Twitter短文本通常不遵守语法句法特性,组词造句存在很强的随意性[2]。……