基于互信息量的改进K-Modes聚类方法

2012-10-21 06:26:30吴润秀
统计与决策 2012年6期
关键词:定义

吴润秀

(南昌工程学院计算 机系,南昌 330099)

0 引言

聚类算法常被称为一种无监督的学习方法,聚类分析是数据挖掘中的主要技术之一,聚类分析是根据组内相似度高,组间相似度低的原则将数据对象进行分类。在聚类过程中一个关键问题就是相似性度量的定义,当数据对象的每个特征均是数值型(实数,整数)时,相似性度量的定义有诸多选择,因为此种情形每个数据对象可用n维空间中的向量来表示(n为特征个数),则n维空间的距离(如欧氏距离,马氏距离,范数距离等)可用来定义对象之间的相似度,且这些度量只仅仅依赖特征向量之间的差值.然而在数据挖掘的应用中,有诸多数据对象是用类型数据来描述的,这使得我们不能通过计算两个特征向量值之差来表示对象之间的距离,最简单的办法是overlap,即若两个对象的属性值相等则为1,不相等则为0,这种简单匹配方法没有把整个数据集考虑进来,Boriah等[2]对类型数据的相似性度量做了较详细的综述和分析,分析了14种相似性度量及其在聚类中的优缺点,这14种相似性度量方法都只考虑了用同一属性值的分布特征来修正属性值之间的相似度,没有考虑数据对象属性之间的相互关系对相似度的影响,白亮等[6]通过用粗糙集中的上下近似集来定义两个属性值之间的距离,张小宇等[7]通过连接度来定义两个属性值之间的距离,Dino Ienco等[1]应用条件概率差来定义两个属性值之间的距离,他……

登录APP查看全文

猜你喜欢
定义
活用定义巧解统计概率解答题
例谈椭圆的定义及其应用
题在书外 根在书中——圆锥曲线第三定义在教材和高考中的渗透
永远不要用“起点”定义自己
海峡姐妹(2020年9期)2021-01-04 01:35:44
严昊:不定义终点 一直在路上
华人时刊(2020年13期)2020-09-25 08:21:32
定义“风格”
成功的定义
山东青年(2016年1期)2016-02-28 14:25:25
有壹手——重新定义快修连锁
修辞学的重大定义
当代修辞学(2014年3期)2014-01-21 02:30:44
山的定义
公务员文萃(2013年5期)2013-03-11 16:08:37