房天下二手交易平台房源数据采集

在许多电商和互联网金融的公司为了更好地服务用户，他们需要爬虫工程师对用户的行为数据进行搜集、分析和整合，为人们的行为选择提供更多的参考依据，去服务于人们的行为方式，甚至影响人们的生活方式。我们的scrapy框架就是爬虫行业使用的主流框架，房天下二手房的数据采集就是基于这个框架去进行开发的。　　数据采集来源：‘房天下----全国二手房’　　目标数据：省份名、城市名、区域名、房源介绍、房源小区、户型、

技术宅也爱玩游戏

867人浏览 · 2021-09-10 14:23:03

技术宅也爱玩游戏 · 2021-09-10 14:23:03 发布

在许多电商和互联网金融的公司为了更好地服务用户，他们需要爬虫工程师对用户的行为数据进行搜集、分析和整合，为人们的行为选择提供更多的参考依据，去服务于人们的行为方式，甚至影响人们的生活方式。我们的scrapy框架就是爬虫行业使用的主流框架，房天下二手房的数据采集就是基于这个框架去进行开发的。

　　数据采集来源：‘房天下----全国二手房’
　　目标数据：省份名、城市名、区域名、房源介绍、房源小区、户型、朝向、楼层、建筑面积、建造时间、单价、楼盘链接

　　数据库设计：province、city、area、house四张表

　　爬虫spider部分demo:

获取省份、城市信息和链接

复制代码

 1 #获取省份名字，城市的链接url
 2     def mycity(self,response):
 3          #获得关键节点
 4         links = response.css('#c02 > ul > li')
 5         for link in links:
 6             try:
 7                 province_name=link.xpath('./strong/text()').extract_first()
 8                 urllinks=link.xpath('./a')
 9                 for urllink in urllinks:
10                     city_url=urllink.xpath('./@href').extract_first()
11                     if city_url[-1]=='/':
12                         city_url=city_url[:-1]
13                     yield scrapy.Request(url=city_url,meta={'province_name':province_name,'city_url':city_url},callback=self.area)
14             except Exception:
15                 pass

复制代码

获取区域的链接url和信息　

View Code

获取二手交易平台房源的信息

View Code

此时就可以运行scrapy crawl+爬虫名，我们就可以爬取到网站的信息，但是我们如何使用这些数据呢，那就要通过pipelines将数据插入到数据库中。

爬虫pipelines部分demo:

View Code

采集数据效果：

魔乐社区

魔乐社区（Modelers.cn) 是一个中立、公益的人工智能社区，提供人工智能工具、模型、数据的托管、展示与应用协同服务，为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作，由全产业链共同建设、共同运营、共同享有，推动国产AI生态繁荣发展。

更多推荐

【计算机视觉】Pixel逐像素分类&Mask掩码分类理解摘要

魔乐社区

计算机视觉（opencv）实战三十二——CascadeClassifier 人脸微笑检测（摄像头）

本文从原理到实现，详细介绍了基于 OpenCV Haar 分类器的人脸与微笑检测：讲解了 Haar 特征和级联检测原理。对代码逐行拆解并解释参数含义。画出完整流程图，帮助理解执行过程。给出了常见问题和优化建议，甚至扩展到深度学习方法。这种方法简单、轻量、实时性好，非常适合入门和小型应用项目。但如果需要更高准确率和更强鲁棒性，建议使用深度学习检测器替代 Haar 分类器。