吴俊华,谭博觉,高 切,陈木生
(江西理工大学 软件工程学院,南昌 330013)
搜索引擎已成为人们上网查找资料最常用的工具。CNNIC2019年3月发布的报告称[1]:截止2018年底,中国网民中使用搜索引擎的用户规模达6.81亿,占全体网民的82.2%,年增长率6.5%。研究表明:85%的搜索引擎用户只查看返回搜索结果中第1页的内容[2-3]。这就意味着检索结果靠前的网站会有更高的关注度、点击率、访问量以及由此带来的更好的广告收入。于是,各个网站使用搜索引擎优化方法(search engine optimization,SEO)提高自身的排名。然而,通过提升自身价值的方式提高排名非常困难,于是有些网站通过欺骗搜索引擎的不正当手段获得较高的排名[4]。这种行为称为网页作弊(web spamming),这些网页就是作弊网页,也称为垃圾网页(web spam)。垃圾网页不仅降低了搜索质量和用户的信任度,让用户转向其他搜索引擎,而且浪费了大量的计算和存储资源,侵占了搜索引擎公司及其他内容网站的合法利益[5]。
垃圾网页检测至今依然是对抗信息检索领域的一项极具挑战性的重要工作。常见的做法是将其视为一个二分类问题,提出各种有效的分类算法用于垃圾网页检测。文献[6]采用支持向量机(support vector machine,SVM)、多层感知器(mulitple level perception,MLP)、贝叶斯网络(bayesian network,BN)、C4.5决策树(C4.5 decision tree,DT)、随机森林(random forest,RF)、朴素贝叶斯(naïve bayes,NB)、K最近邻(K-nearest neighbour,KNN)以 及AdaBoost、LogitBoost、Real AdaBoost、Bagging、Dagging和Rotation Forest等分类算法分别基于内容特征、链接特征和综合特征进行垃圾网页检测,但其分类结果与其他研究结果相比并非更优。文献[7]提出一种包含概率映射图自组织映射(probabilistic mapping graph self-organizing map,PM-G)和图神经网络(graph neural network,GNN)的图层……