储 光,胡学钢,张玉红
(合肥工业大学 计算机与信息学院,合肥 230009)
网络社交媒体在现实生活中被广泛应用,例如网络聊天、购物评论和在线新闻等,由此产生了大量的文本数据流。这些数据流的主题会随着时间随机变化,这种变化被称为概念漂移[1-2]。概念漂移检测是数据流分类中的重要问题。
根据数据流是否含有标记信息,可将现有的概念漂移检测算法分为监督、无监督和半监督3类。监督方法适用于有标记数据,依据衡量数据流分类过程中的错误率变化程度进行概念漂移检测,衡量模型包括伯努利分布[3-5]、决策树[6-8]和Bayes模型[9]等。无监督方法适用于无标记数据,主要分为2种:一种是借助聚类等方法,通过比较聚类簇的变化程度进行概念漂移检测[10];另一种是借助特征向量化和特征提取的方法,通过比较提取出的特征集合或是依据特征计算出的信息熵的变化程度进行概念漂移检测[11]。半监督方法适用于部分标记数据,概念漂移检测方法大多与无监督方法一致[12]。上述方法都基于某种信息量的变化程度进行概念漂移检测,其中监督方法效果直接取决于基分类器的性能,无监督或半监督方法效果直接取决于聚类或者特征提取效果,在一定条件下可以有效地实现概念漂移检测。
然而在实际应用中,由于信息的传播速度快、交流范围广,导致文本数据流中的概念通常会随着时间频繁变化。例如在奥运会期间,体育新闻的内容会随着项目不同而不停更新,从球类到游泳,从田径到射击,项目最密集时这种更新甚至会以分钟为单位。……