张禄成,陶冶,崔文华



[中图分类号] TP393.09
[文献标志码]A
[文章编号]2095-6487 (2021) 02-0157-02
Python-based Data Crawling and Analysis of Second-hand Housing in Anshan City
Zhang Lu-cheng,
TaoYe,
CuiWen-hua
[ Abstract] Witri the rapid development of the Intemet, we have entered the era of big data. In the current era of big data, how to obtain usefulinformation has become a major problem. The article takes second-hand houses in Anshan City as an example, and uses Python to analyze and visualize thesecond-hand houses in 58 same city to show the information of second-hand houses in Anshan C.ity. Through the analysis of these second-hand houses, wehave also obtained some price analysis charts about the price information of second-hand houses in Anshan City
[ Keywords] Py~hon; data visualization; crawler
互联网的快速发展,使人类社会的信息越来越多。经济的快速发展导致年轻人在刚毕业时无法购买到价格适宜且环境舒适的房屋,租房成了热门选择。目前学者对住房价格差异研究方法有两类:一类是创立特征价格模型,即对房子的各个因素进行量化考量并权重加分计算。第二类是使用GIS技术和地统计学,对住房价格进行一些地理规律的考量。【1】综合以上两种方法,分区分块、分户型和而积的研究房屋价格的影响因素。
Python是当今大热一门编程语言,其拥有良好的生态,尤其是在数据处理和数据分析方而具有高效快捷的优点。而对复杂的二手房数据信息,Python可以快速对这些数据进行爬取与清洗。
首先要进行房源基本信息的爬取以获得当前最新的数据,本文针对58同城(https://as.58.com/ershoufang/pn)上的二手房进行数据爬取。网络爬虫,Python有属于自己的库以供使用者爬取信息。该爬虫是以对58二手房信息网站进行数据爬取保存在本地文件夹中。本次数据分析爬虫总爬取的有效数据统计2300个,以下数据和图表电均为该数据所获得的结论。
对于二手房数据的爬取,选用Requests库和Lxml下的Etree库对所要爬取数据的网站发送请求加上xpath插件对网页进行解析,最后把我们所需要的数据爬取出来放在本地的csv或者txt格式文件中。爬虫部分的编写选用Pycharm环境编译。简单来说这个爬虫的工作……