黄 进,何中市,李英豪
(重庆大学 计算机学院,重庆 400044)
万维网中不能被传统搜索引擎通过静态链接索引到的内容称为Deep Web。要获取这部分内容只能通过表单提交查询的方式获得[1-2]。Deep Web数据源的分类是指把所有发现的数据源按照领域进行划分,是Deep Web数据源集成的关键步骤之一[3]。目前Deep Web数据源分类,多数研究采用的是有监督的分类方法。而一个标注好的数据集,需要大量的人工知识,并且随着万维网的快速发展,训练集要考虑更新与扩展。这些对于自动化的数据集成都是很大的阻碍。在最新的Deep Web研究进展与综述中[4],也明确指出结合机器学习,数据挖掘等领域的无监督的研究方法是今后的研究重点。
目前也有一部分研究人员关注聚类方法的研究。B.He[5]提出了MDhac方法,将表单属性看做分类数据(categorical data),采用基于模型的聚类,用卡方检验来作为距离函数,进行聚类。L.Barbosa[6]等人提出了基于表单内容和表单页面上下文的K-Means聚类方法。Zhao Pengpeng[7]等人提出基于图模型的聚类方法,算出数据源两两间的权值并连接成有权图,然后进行划分聚类。Xu Guangyue[8]等人提出了先聚类后分类的方法。先用LDA模型进行主题划分,用主题数代表聚类数目,将达到聚类精度的数据作为训练集,训练出分类模型,对前一步中聚类效果不好的数据进行后分类。
通过对国内外相关文献的阅读与研究,在了解目前的主要方法后发现,目前在Deep Web数据源特征提取和聚类数目的自动化确定方面还未有研究工作。正如前面提到的这些方法,都需要事先设定聚类个数或者特征个数。……