1200字范文,内容丰富有趣,写作的好帮手!
1200字范文 > python爬虫破解大众点评的字体加密

python爬虫破解大众点评的字体加密

时间:2020-02-04 10:22:09

相关推荐

python爬虫破解大众点评的字体加密

大众点评最大的难题就是字体加密,也就是这样

很明显点评网宁可错杀一万,也不肯放过一个,干脆使用了自己定义的字体。不过既然自定义了字体,那么网页肯定需要加载字体文件。

谷歌浏览器,右键检查,进入network 然后刷新页面,点击Font。

我们来下载这个加载的字体:8f8cfde4.woff

右键 copy like address

粘贴到新页面 即可下载

将下载的字体导入FontEditor中打开

(百度家的在线字体编辑器)

/static/editor/index.html

导入之后:

我们再结合网页源代码,就得到了相应乱码与数字的对应关系:

我们可以发现网页中的乱码和FontEditor中的乱码后四位是一样的,比如说图中某店铺的点评数为2481,在网页源代码用【1】来表示,这在FontEditor的字体编辑器中对应的是【unie801,unieb78,uniefe4】。

所以我们要做的是:

1、下载网站font字体包

2、将font字体包中导入FontEditor观察得到乱码与数字的关系

3、前缀替换,并将字体名字和它们所对应的乱码构成一个字典

运行看一下:

没错,跟刚才观察的结果一致。

那么下面我们获取网页源代码,并根据刚才 get_font()构成的字典进行替换。

再看一下结果:

这样就破解了点评网的字体加密。

剩下各位就可以自行用喜欢的解析方式来解析html啦。

本文首发于公众号《凹凸玩数据》

本文相关爬python代码已上传公众号后台,

关注公众号《凹凸玩数据》后回复“大众点评”即可

本内容不代表本网观点和政治立场,如有侵犯你的权益请联系我们处理。
网友评论
网友评论仅供其表达个人看法,并不表明网站立场。