陈冬玲,曾 文
(1.沈阳大学 信息科学与工程学院,辽宁 沈阳 110044;2.中国科学技术信息研究所,北京 100038)
频繁模式挖掘中基于CFP的应用模型
陈冬玲1,曾 文2
(1.沈阳大学 信息科学与工程学院,辽宁 沈阳 110044;2.中国科学技术信息研究所,北京 100038)
为进一步提高频繁模式挖掘效率,对CFP构造算法做了部分改进,并提出了一些基于此结构的应用方法.实验和分析表明,改进的CFP算法在各种不同的数据挖掘应用中更加有效.
频繁模式;挖掘算法;应用方法;CFP
频繁模式挖掘是目前一个重要的研究领域,并得到了广泛的应用.目前频繁模式的挖掘主要有两类算法.一类是基于Apriori的广度优先算法[1].这种方法的思想是如果一个模式不是频繁模式,那么包含此模式的超模式也一定不是频繁模式.采用循环的方式,通过长度为L-1的频繁模式,组合成长度为L的候选模式,然后扫描数据库得到长度为L的频繁模式.这类方法的思想简单,也不需要复杂的数据结构,容易实现.但这种generation-and-test的方法需要产生大量的候选集,而且需要多次的扫描数据库,这个过程需要花费大量的时间.另一类是基于FP-growth的深度优先算法[2-4],这种算法采用一种新颖的、紧凑的数据结构来存储数据库中所有的频繁项.因为频繁模式中的所有项必须是频繁项,所以挖掘过程不需要在整个数据库中进行.即先扫描数据库,得到所有的频繁项,把所有的频繁项按照一定的顺序插入到频繁模式树中(FP-tree).和Apriori相比,此算法不需要多次重……