李仕杨
摘要:随着数据库技术及万维网(WWW)技术的迅速发展,大量形式各异的复杂类型数据不断涌现。因此数据挖掘面临重要课题是针对复杂类型数据的挖掘,其中Web数据尤为重要。本文通过分析Web数据挖掘的特点及分类,针对常用技术和主要应用方向进行探讨,以其充分发挥web数据挖掘的作用,服务信息化社会。
关键词:web;数据挖掘;信息服务;常用技术
1 Web数据挖掘的特点
万维网目前是一个巨大的、分布广泛的和全球性的信息服务中心,它涉及新闻、广告、消费信息、金融管理、教育、政府、电子商务和许多其他信息服务。Web还包含了丰富和动态的超链接信息,以及Web页面的访问和使用信息,这为数据挖掘提供了丰富的资源。然而,Web挖掘不仅仅是数据挖掘算法在Web数据上的应用,同传统的数据库数据相比,Web数据具有其特殊性,其特点就是数据没有严格的结构模式,含有不同格式的数据(文本、声音、图像等),面向显示的Html文本无法区分数据类型,并且存在大量的冗余和噪声,同时Web是一个动态性极强的信息源,所以面向Web的数据挖掘研究极具挑战性。
2 Web数据挖掘的分类
2.1 web结构挖掘
Web结构包括不同网页之间的超链接结构和一个页面内部的树形结构,以及文档URL中的目录路径结构等。Web结构可以用有向图表示,页面对应图中的点,超级链接对应图中的边。通过把Web表示成有向图,可以得到从一个站点的主页到它任意一个定点的最短路径,Robot沿最短路径浏览Web站点,就可以以较小的代价发现较多的文档。……