饶毓和, 凌志浩
(华东理工大学化工过程先进控制和优化技术教育部重点实验室,上海 200237)
随着互联网日益深入人们的日常生活,以互动交流为特点的Web2.0 技术进入了高速发展阶段,其中包括Twitter、微博、Facebook 以及各种即时信息工具等多种互联网新媒体平台。这些平台每时每刻都在产生着大量的内容简短、特征稀疏的半结构性或非结构性文本数据,如何处理这些短文本数据进而从中提取出有价值的信息已经成为当下互联网领域的技术热点。
文本聚类是文本信息挖掘领域的一个常见方向,目前已被广泛用于信息检索、搜索引擎等方面,然而对于短文本而言,其所具有的高维度性和特征稀疏性使得短文本聚类面临着诸多挑战。稀疏性带来了包括上下文信息不足、词共现信息不足等问题,具体来说,由于短文本所包含的单词数量很少,且大部分单词只出现一次,如果继续使用传统的向量空间模型(Vector Space Model, VSM)来表示短文本,极度稀疏的高维特征向量将会导致内存与计算时间的过度开销。另外,由于单词数量过少,词频统计将失去意义,所以常用的词频-逆文档频率加权(TF-IDF)也不适用于短文本[1]。
为了克服短文本的稀疏性和高维度性,相关学者已经进行了大量研究,比如引入外部信息源或重新构建新的针对短文本的模型等。然而,在如何进一步提升短文本聚类质量方面的研究目前还有待深入。文本聚类的关键在于对文本特征的提取,而现有常用的文本特征大都存在所含信息单一且信息量较少的缺陷,进而导致文本聚类时特征对短文本的区分能力不强,聚类效果有待改善。……