王彦婕
(山西省信息产业技术研究院有限公司,山西 太原 030012)
随着信息产业技术的不断发展,互联网逐步成为大众获取与交流信息的最大平台,我们通过在网页中简单地搜索相关词语就可以得到我们想要的信息,在科技服务平台网上搜索关键词就能获取科技相关方面的知识。在搜索引擎不断更新交替的现状下,最初的传统搜索服务手段已经被淘汰,现代社会越来越不满足落后且单一的大众化搜索服务,信息发展急切需要全面精准的专业化信息检索服务。本文基于数据挖掘技术,获取了大量科技类文本数据,并结合项目已有的大量科技平台数据,建立一个数据量大且有效性高的数据库,并对数据进行清洗、处理、量化、建模等步骤,以便于进一步服务于科技搜索引擎。
数据采集是所有数据挖掘研究的基础,构建一个数据量大,数据有效性高的数据资源库是一切数据挖掘研究的基础。我们可以利用网络爬虫技术来定向获取或非定向获取数据,根据网络爬虫相关规则:以某个选定科技服务网站作为起始网站,通过各个网站页面的超链接遍历整个网络,利用URL根据广度优先算法从一个网页文档爬取到另外一个网页文档来获取所有数据信息。
数据采集后将所有数据汇集形成自有科技数据库。整合现有数据,包含各类科技数据;科技项目中整个项目生命周期中的数据包括管理数据、申报数据、申报信息、结题验收信息及产生的成果数据;……