王 晶,张春英
(河北理工大学 理学院,河北 唐山063009)
数据挖掘算法是在数据中寻找一种模式。现存的大多数数据挖掘方法都是在单一的表中寻找模式。而一个关系数据库一般由几个表组成,而不是一个表。近几年,数据挖掘的算法和模式已经扩展到多关系方面,而多关系学习(MRDM,MRL)方法也称为关系学习,是从关系数据库中寻找涉及多表(多关系)的模式。
分类是数据挖掘的一种主要的应用形式,其应用遍历机器学习、模式识别、统计学、神经网络、遗传算法、数据库、专家系统等多个领域。分类算法的核心部分是构造分类器。贝叶斯分类算法是数据挖掘领域的一种常用的分类方法,它是统计学分类方法,利用概率进行分类。
目前,在关系学习中,贝叶斯分类算法有很多种,对这些算法进行总结、比较,指出其优点与不足,对提高分类效率有很大帮助。故本文对已有的关系学习中贝叶斯分类算法作了详细的比较,并进行归纳总结。本文第三部分是对单关系学习中贝叶斯分类算法的比较;第四部分是对多关系学习中贝叶斯分类算法的比较;最后是对本文工作的总结与展望。
给定一个具有K个属性的数据集,假设这K个属性值均为离散值,分类任务是预测测试集中每一个例子的类别。给定一个具体的例子,其属性值从ai到ak,该例子属于某一个类ci的概率是P(C=ci| A1=a1…
Ak=ak)。显然如果该例子属于某一个类的概率值具有最大值,那么该例子就属于这个类。……