scrapy爬取网站返回json数据处理

找到下一页,根据时间戳拼接完整的加载更多url。# for循环遍历数据,取出每一条段子。需要在middlewares文件中设置的一下随机请求头。## 发起请求。# 转换为python中的字典。# 取出下一页的时间戳。# 返回的是json数据。

叶落无痕123

926人浏览 · 2022-09-19 18:08:48

叶落无痕123 · 2022-09-19 18:08:48 发布

# -*- coding: utf-8 -*-
import scrapy
import json
 
class NeihanSpider(scrapy.Spider):
    name = 'neihan'
    allowed_domains = ['neihanshequ.com']
    start_urls = ['http://neihanshequ.com/bar/1/?is_json=1&app_name=neihanshequ_web&max_time=1521163598']
 
    def parse(self, response):
 
        # 返回的是json数据
        # 转换为python中的字典
        rs =  json.loads(response.text)
        if rs.get('message') == 'success':
            # 取出数据
            data = rs.get('data')
            # 取出下一页的时间戳
            max_time = data.get('max_time')
            # 段子数据
            detail_data = data.get('data')
            # for循环遍历数据,取出每一条段子
            for dz in detail_data:
                text = dz.get('group').get('text')
                print(text)
 
            # 找到下一页,根据时间戳拼接完整的加载更多url
            # if max_time:
            #     next_url = 'http://neihanshequ.com/bar/1/?is_json=1&app_name=neihanshequ_web&max_time='+str(max_time)
            #     # 发起请求
            #     yield scrapy.Request(
            #         url=next_url
            #     )

需要在middlewares文件中设置的一下随机请求头

魔乐社区

魔乐社区（Modelers.cn) 是一个中立、公益的人工智能社区，提供人工智能工具、模型、数据的托管、展示与应用协同服务，为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作，由全产业链共同建设、共同运营、共同享有，推动国产AI生态繁荣发展。

更多推荐

【计算机视觉】Pixel逐像素分类&Mask掩码分类理解摘要

魔乐社区

计算机视觉（opencv）实战三十二——CascadeClassifier 人脸微笑检测（摄像头）

本文从原理到实现，详细介绍了基于 OpenCV Haar 分类器的人脸与微笑检测：讲解了 Haar 特征和级联检测原理。对代码逐行拆解并解释参数含义。画出完整流程图，帮助理解执行过程。给出了常见问题和优化建议，甚至扩展到深度学习方法。这种方法简单、轻量、实时性好，非常适合入门和小型应用项目。但如果需要更高准确率和更强鲁棒性，建议使用深度学习检测器替代 Haar 分类器。