林 振 宇,解 吉 波,杨 腾 飞,刘 战,赵 静
(1.海南省地球观测重点实验室,海南 三亚 572000;2.中国科学院空天信息创新研究院,北京100094;3.国家海洋局东海预报中心,上海 200136;4.河南理工大学测绘与国土信息工程学院,河南 焦作 454000;5.中国科学院大学,北京 100049)
随着“互联网+旅游”技术的蓬勃发展,游客在旅行过程中使用社交媒体平台以文本形式记录游览经历。通过这些文本分析游客的情感倾向(正面或负面),不仅能为其他潜在旅游者制定旅游计划提供参考,也能为景区管理者改善景区质量、提高景区吸引力提供决策支持。但这些文本信息具有非结构化特征,很难被直接有效利用,尤其是其中蕴含的景区多主题特征以及公众对该特征的情感倾向,因此,建立一种自动化抽取其有效信息的方法尤为重要。
多主题情感词典的构建是旅游信息抽取和分析的基础,其核心内容包括主题特征词的抽取和基于主题词的情感词筛选。主题特征词抽取一般基于统计的方法[1],选出文本中出现频率超过阈值的词作为主题词;但该方法未考虑词与词之间的关系,实际应用中易被噪声数据影响,使得抽取的主题词不能反映文本的真实情况。故一些学者引入机器学习方法[2]以改善噪声数据的影响,也有学者针对词与词之间的关系提出改进方法,如耿焕同等[3]提出基于词共现图的主题词抽取方法,陈炯等[4]提出基于词聚类的主题提取方法。目前,多数研究基于专家标注的情感词典进行词典构建或扩展,如Baccianella等[5]基于WordNet构建SentiWordNet词典,Hu等[6]基于WordNet和bootstrapping算法扩展情感词典。……