1200字范文,内容丰富有趣,写作的好帮手!
1200字范文 > Python的爬虫包Beautiful Soup中用正则表达式来搜索

Python的爬虫包Beautiful Soup中用正则表达式来搜索

时间:2021-09-29 21:56:17

相关推荐

Python的爬虫包Beautiful Soup中用正则表达式来搜索

后端开发|Python教程

Python,BeautifulSoup,正则表达式,爬虫,搜索

后端开发-Python教程

Beautiful Soup使用时,一般可以通过指定对应的name和attrs去搜索,特定的名字和属性,以找到所需要的部分的html代码。

易语言手机定位源码,vscode配置ftp,pgi ubuntu,访问地址Tomcat,c# sqlite 注入,discuz 插件位置,前端页面的框架有什么,天猫有防爬虫,ajax传值php,网络seo广告价格,免费网站模板 百度一下,网页 简单的计算器代码,app网站模板下载lzw

但是,有时候,会遇到,对于要处理的内容中,其name或attr的值,有多种可能,尤其是符合某一规律,此时,就无法写成固定的值了。

rt 54u源码,ubuntu gnome6,tomcat不能开机启动,爬虫相似图片,php教程最新学习,inanchor:seolzw

所以,就可以借助正则表达式来解决此问题。

比如,

游戏家族网站源码,vscode如何写lisp,ubuntu vi升级,如何测试打开tomcat,java爬虫cw,php json 中括号,德州seo优化排名选哪家,汽车之家网站模板,站长之家 网页模板lzw

crifan

对应的BeautifulSoup代码如下:

h1userSoup = soup.find(name="h1", attrs={"class":"h1user"});

而如果html是这种:

crifan

crifan 123

crifan 456

那么想要一次性地找到所有的,符合条件的h1的部分的代码,则之前的写法,就只能找到单个的class=”h1user”的部分,剩下的两个

class="h1user test1"

class="h1user test2"

就找不到了。

那么,此时,就可以用到,BeautifulSoup中非常好用的,非常强大的功能:

attrs中支持正则表达式的写法

了。

就可以写成:

h1userSoupList = soup.findAll(name="h1", attrs={"class":pile(r"h1user(\s\w+)?")});

就可以一次性地,找到:

class="h1user"class="h1user test1"class="h1user test2"

了。

之类的标签,xxx的内容未知(可变)的前提下

想要查找到对应的此div标签,之前不知道如何实现。

如果写成:

sopu.findAll("div", attrs={"aria-lable": "xxx"});

则xxx必须写出来,如果不写出来属性值,也就没法用上attrs了,就没法实现此处查找特性属性值的标签了。

所以针对:

747 份评分

可以通过:

soup.findAll("div", attrs={"aria-lable": True});

去查找到属性包含aria-lable的div标签的。

所以,对于上面的,之前不知道如何处理:

用BeautifulSoup查找未知属性值,但是已知属性的名字的标签

则此处,就可以针对:

去用:

sopu.findAll("div", attrs={"aria-lable": True});

就可以查找到对应的包含属性aria-lable的div标签了。

本内容不代表本网观点和政治立场,如有侵犯你的权益请联系我们处理。
网友评论
网友评论仅供其表达个人看法,并不表明网站立场。