王 君,马乐荣
(延安大学 数学与计算机科学学院,陕西 延安 716000)
新型冠状病毒(2019-nCov)[1]是一类具有囊膜、基因组为线性单股正链的RNA病毒,是自然界广泛存在的一大类病毒[2]。该病毒在爆发前期,感染人数迅速上升,病毒在感染者身上会有一定时间的潜伏期,在此期间容易传染到接触者。由于新冠肺炎疫情在武汉的集中爆发,并迅速向全国各地蔓延,各省(自治区、直辖市)卫生健康委员会每天定时发布前一天的疫情相关数据,包括新增确诊病例、累计确诊病例、新增出院病例等,为人们的生活、出行、工作提供信息支持。
尽管也有一些平台收集资料并进行发布,但是想要第一时间获取数据最好的方式还需要在官网上进行查看。如果采用人工的方式收集数据,由于数据量庞大,这会花费大量时间,而且会存在手工整合数据错误的问题。因网络平台不同、数据格式不同,且数据每日都在更新,这样给及时获取数据带来了巨大的挑战。数据是分析、可视化、预测的基础,第一时间获取数据可以更方便的显示疫情数据的变化,了解国家对疫情把控的及时性。因此,本文使用Python语言、Scrapy库爬虫库和MongoDB[3]数据库,设计并实现了新冠肺炎疫情信息累积更新采集系统。该系统能对不同的网页结构采取不同的获取数据策略,并采用正则表达式对获取的文本进行数据清洗。实验结果表明,该系统具有良好的性能,并可推广使用。
国家卫生健康委员会和31个省(自治区、直辖市)卫生健康委员会网站上设有疫情通报栏目,点击后会出现当日以前每一天的疫情情况。……