高中生
What?

- 金币
- 255
- 好评
- 9
- 信誉
- 100


|
本帖最后由 DDG667 于 2022-7-16 14:08 编辑
这是第二篇,先看第一篇。
然后开启抓包并刷新网页
随便找一个选请求
header就到手了,复制下来写个Python字典备用
然后请求网页
https://www.wmgirl.com/2684.html
requests有很多方法,这里我们只用到get
然后r.text就是我们刚刚看的网页源码了
这时候就要分析数据,把图片的url给筛出来
可以用bs4,xpath,re
我个人喜欢re
拿出我们刚刚复制的源码(第一篇里的)
- <img src="https://img.wmgirl.com/storage/vgs/img/98z_2017-03-07_22-47-57.jpg" title="陌上花" alt="陌上花" >
复制代码
修改成正则表达式形式的,re怎么写,自行Google或维基百科吧
- <img src="(.*?)" title=".*?" alt=".*?" >
复制代码
. 匹配任意单个字符
*匹配几次或多次来着我忘了
?非贪婪模式,匹配到最近的一个
()里是会返回的内容
然后用re的findall放法(因为有多张图,所以findall)
第一个位置放正则表达式,第二个方要匹配的字符,也就是我们的网页源码
返回的是列表,所以用for循环print一下
OK没有问题,接下来以二进制下载文件
.content就是获取二进制文件
第16行是保存目录
运行一下看看效果
爬出来了
但一页一页的爬未免太慢了
所以,回到分类
看源码
可以找到每页的不完整的url
点进去看看
相信这应该难不倒能看懂这篇的人,自己拼接一下,套在上面就OK了
觉得慢可以开线程池
写到这就算了,累啊。
|
本帖子中包含更多资源
您需要 登录 才可以下载或查看,没有账号?立即注册
x
|