顾亦然,陈禹洲
(南京邮电大学自动化学院、人工智能学院,江苏南京 210046)
人们平时通过电商平台购物,看到愿意购买的商品时,通常会想要查看这件商品的具体信息,如颜色种类、尺寸大小及商品评论等。而很多商品的评论信息数量实在太大,并且会有各种虚假信息,查看及筛选颇为费时耗力。一些电商平台很贴心地给出了评价标签,将所有的评论信息聚类成几个评价标签,让用户查看时一目了然,并且对这件商品有一个直观的印象。消费者也可以单独查看某个评论标签下的所有评论信息,再决定是否购买商品,而这也是商家看重评论的重要原因。
评论信息中的有用词汇,一般都为情感词,因而需要对情感词进行提取,然后聚类,从而形成评价标签。因此,选择合适的聚类方法十分重要。
常用的文本聚类算法包括K-means 聚类算法、层次聚类算法、密度聚类算法,以及神经网络模型聚类算法等。K-means 是情感词聚类的经典算法,在聚类分析中经常被使用的一种迭代求解的无监督学习算法。该算法具有结构简单、运行速度快等特点,对大数据分析的效率较高、可伸缩性较强,因此常被用于数据挖掘任务中。但缺点也较为明显,K-means 算法在训练过程中容易陷入局部最优解,其聚类个数需要人为确定,并且聚类个数和初始聚类中心对整个K-means 算法的结果影响较大。
SOM 是自组织映射算法,是一种无导师学习网络,它通过自动寻找文本中的内在规律和本质属性,自组织、自适应地改变网络结构和参数。……