基于DIRICHLET过程的DEEP WEB数据源聚类方法

2015-09-21 01:29:40何中市李英豪
网络安全与数据管理 2015年7期
关键词:特征提取分类特征

黄 进,何中市,李英豪

(重庆大学 计算机学院,重庆 400044)

0 引言

万维网中不能被传统搜索引擎通过静态链接索引到的内容称为Deep Web。要获取这部分内容只能通过表单提交查询的方式获得[1-2]。Deep Web数据源的分类是指把所有发现的数据源按照领域进行划分,是Deep Web数据源集成的关键步骤之一[3]。目前Deep Web数据源分类,多数研究采用的是有监督的分类方法。而一个标注好的数据集,需要大量的人工知识,并且随着万维网的快速发展,训练集要考虑更新与扩展。这些对于自动化的数据集成都是很大的阻碍。在最新的Deep Web研究进展与综述中[4],也明确指出结合机器学习,数据挖掘等领域的无监督的研究方法是今后的研究重点。

目前也有一部分研究人员关注聚类方法的研究。B.He[5]提出了MDhac方法,将表单属性看做分类数据(categorical data),采用基于模型的聚类,用卡方检验来作为距离函数,进行聚类。L.Barbosa[6]等人提出了基于表单内容和表单页面上下文的K-Means聚类方法。Zhao Pengpeng[7]等人提出基于图模型的聚类方法,算出数据源两两间的权值并连接成有权图,然后进行划分聚类。Xu Guangyue[8]等人提出了先聚类后分类的方法。先用LDA模型进行主题划分,用主题数代表聚类数目,将达到聚类精度的数据作为训练集,训练出分类模型,对前一步中聚类效果不好的数据进行后分类。

通过对国内外相关文献的阅读与研究,在了解目前的主要方法后发现,目前在Deep Web数据源特征提取和聚类数目的自动化确定方面还未有研究工作。正如前面提到的这些方法,都需要事先设定聚类个数或者特征个数。……

登录APP查看全文

猜你喜欢
特征提取分类特征
分类算一算
如何表达“特征”
基于Gazebo仿真环境的ORB特征提取与比对的研究
电子制作(2019年15期)2019-08-27 01:12:00
不忠诚的四个特征
当代陕西(2019年10期)2019-06-03 10:12:04
教你一招:数的分类
一种基于LBP 特征提取和稀疏表示的肝病识别算法
基于MED和循环域解调的多故障特征提取
线性代数的应用特征
河南科技(2014年23期)2014-02-27 14:19:15
Walsh变换在滚动轴承早期故障特征提取中的应用
轴承(2010年2期)2010-07-28 02:26:12