Python爬虫常用正则表达式及HTML网页标签分析总结_python正则怎么删掉span

输出如下图所示：当然如果是通过Selenium分析DOM树结构获取href对应的url或title中的值，其核心代码如下所示，这里主要是给大家做个对比，理解不同方法的优势：通常在使用Python爬取图片过程中，会遇到图片对应的URL最后一个字段通常用于命名图片，如虎扑孙悦妻子图片：此时需要通过该URL的"/"后面的参数命名图片，则方法如下：输出如下所示：在使用Python获取GET方法的URL链接

前端热点排行

460人浏览 · 2024-04-26 15:14:42

前端热点排行 · 2024-04-26 15:14:42 发布

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

输出如下图所示：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

当然如果是通过Selenium分析DOM树结构获取href对应的url或title中的值，其核心代码如下所示，这里主要是给大家做个对比，理解不同方法的优势：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

通常在使用Python爬取图片过程中，会遇到图片对应的URL最后一个字段通常用于命名图片，如虎扑孙悦妻子图片：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

此时需要通过该URL的"/"后面的参数命名图片，则方法如下：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

输出如下所示：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

在使用Python获取GET方法的URL链接中，还可能存在传递参数的值。

此时获取参数方法如下：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

输出如下所示：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

4.爬取网页中所有URL链接

在学习爬虫过程中，你肯定需要从固有网页中爬取URL链接，再进行下一步的循环爬取或URL抓取。如下，爬取CSDN首页的所有URL链接。

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

输出如下所示：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

5.爬取网页标题title两种方法

获取网页标题也是一种常见的爬虫，如我在爬取维基百科国家信息时，就需要爬取网页title。通常位于标题中。

下面是爬取CSDN标题的两种方法介绍：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

输出如下所示：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

6.定位table位置并爬取属性-属性值

如果使用Python库的一些爬取，通常可以通过DOM树结构进行定位，如代码：

login = driver.find_element_by_xpath (“//form[@id=‘loginForm’]”)

但如果是正则表达式这种相对传统傻瓜式的方法，通过通过find函数寻找指定table方法进行定位。如：获取Infobox的table信息。

通过分析源代码发现“程序设计语言列表”的消息盒如下：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

print infobox 输出其中一门语言ActionScript的InfoBox消息盒部分源代码如下：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

然后再在这个infobox内容中通过正则表达式进行分析爬取。下面讲述爬取属性-属性值：

爬取格式如下：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

其中th表示加粗处理，td和th中可能存在属性如title、id、type等值；同时之间的内容可能存在或或
等值，都需要处理。下面先讲解正则表达式获取td值的例子：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

Python代码如下：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

如果包含该属性则正则表达式为r’(.*?)‘；同样如果不一定是id属性开头，则可以使用正则表达式r’<td .*?>(.*?)'。

7.过滤等标签

在获取值过程中，通常会存在、
、等标签，下面举个例子过滤。

(字) 翔宇过滤标签核心代码：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

代码如下，注意print中逗号连接字符串：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

输出如下所示：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

8.获取等标签内容

比如在获取游讯网图库中，图集对应的原图它是存储在script中，其中获取原图-original即可，缩略图-thumb，大图-big，通过正则表达式下载URL：

res_original = r’“original”:“(.*?)”’ #原图 m_original = re.findall(res_original,script)

代码如下：

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

运行结果如下图所示，同时下载图片至E盘。

外链图片转存失败,源站可能有防盗链机制,建议将图片保存下来直接上传

9.通过replace过滤
标签

在获取值过程中，通常会存
标签，它表示HTML换行的意思。常用的方法可以通过标签’<‘和’>'进行过滤，但是这里我想讲述的是一种Python常用的过滤方法，在处理中文乱码或一些特殊字符时，可以使用函数replace过滤掉这些字符。核心代码如下：

一、Python所有方向的学习路线

Python所有方向路线就是把Python常用的技术点做整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

二、学习软件

工欲善其事必先利其器。学习Python常用的开发软件都在这里了，给大家节省了很多时间。

三、入门学习视频

我们在看视频学习的时候，不能光动眼动脑不动手，比较科学的学习方法是在理解之后运用它们，这时候练手项目就很适合了。

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！
size_20,color_FFFFFF,t_70,g_se,x_16#pic_center)

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

魔乐社区

魔乐社区（Modelers.cn) 是一个中立、公益的人工智能社区，提供人工智能工具、模型、数据的托管、展示与应用协同服务，为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作，由全产业链共同建设、共同运营、共同享有，推动国产AI生态繁荣发展。

更多推荐

替你试过了，消费级显卡可以跑的开源文生图SOTA模型，顶级渲染、高密度文本绘图

魔乐社区

量化挑战赛冠军专访：4小时啃下W4A8量化，我靠的是这些经验

魔乐社区

小参数・大码力・易部署 | Qwen3.6-27B上线魔乐社区，基于昇腾的部署教程来了

继一周前模型开源发布后，千问再度开源Qwen3.6-27B —— 一个拥有270亿参数的稠密多模态模型，也是社区呼声最高的模型规格。Qwen3.6-27B 依然支持多模态思考与非思考模式，在智能体编程方面达到了旗舰级表现，全面超越前代开源旗舰 Qwen3.5-397B-A17B（总参数397B / 激活参数17B的MoE模型）。作为稠密架构，它无需MoE路由即可部署，是开发者在实用、可广泛部署规模