段继磊

摘要:介绍了朴素贝叶斯分类算法的理论,研究了朴素贝叶斯算法在信用卡金融数据挖掘中的应用。实验结果表明了朴素贝叶斯算法是一种非常有效的算法。
关键词:朴素贝叶斯算法;分类;数据
Abstract:In this paper, the na?ve bayes classification algorithm theory is introduced. The application of na?ve bayes classification algorithm in credit financial data mining is researched. The experimental results indicate that the na?ve bayes classification algorithm is an effective algorithm.
Key words:Na?ve bayes algorithm; Data mining; Credit
一、引言
近年來,数据挖掘技术在金融领域中的应用备受关注[1]。朴素贝叶斯分类(Naive Bayes,NB)方法[2,3]是一种著名的数据挖掘算法,它基于贝叶斯理论,具有简单而有效的特征。本文首先说明了朴素贝叶斯分类算法的原理和方法,而后研究了朴素贝叶斯算法在信用卡金融数据挖掘中的应用,实验结果表明了朴素贝叶斯算法是一种非常有效的分类算法。
二、朴素贝叶斯分类算法
对于任意样本 ,其特征为 ,特征中 表示样本 中出现的第i个特征项。样本的类别为k个,即 。假设在给定的条件下,特征项之间不存在任何依赖关系,都是相互独立的。那么根据朴素贝叶斯分类算法,样本 与已知各类的条件概率 定义为: (1)
因为 对计算结果没有影响,所以可以省略。而 (2)
其中, 和 可以通过如下的公式来估计: (3) (4)
其中 表示类 中的样本数目, 为特征项 在类 中出现的词频总数。
对样本 进行分类,就是按公式(1)计算所有样本类在给定 情况下的概率,概率值最大的那个类就是 所在的类,即:
(5)
三、实验分析
(一) 数据集
实验中采用的数据集是在UCI数据库[4]中的Credit Approval数据集。Credit Approval数据集包括了16个属性,共有690个样本。
(二)评价指标
本文采用精度来衡量分类算法的性能。分类器对样本的分类结果有4种情况。……