您好, 欢迎来到 !    登录 | 注册 | | 设为首页 | 收藏本站

Python爬虫入门!破解pexels高清原图!零基础必学教程!

5b51 2022/1/14 8:25:01 python 字数 7032 阅读 878 来源 www.jb51.cc/python

最近貌似对好看的图着迷,Pixabay爬不到原图不甘心呀。 百度+知乎了下,于是转向pexels,同样一个高人气图片网站。

概述

最近貌似对好看的图着迷,Pixabay爬不到原图不甘心呀。

百度+知乎了下,于是转向pexels,同样一个高人气图片网站。

Python爬虫入门!破解pexels高清原图!零基础必学教程!

Python爬虫入门!破解pexels高清原图!零基础必学教程!

1、分析查看

首先点击进入官网,又见瀑布流,点击查看源码。进群:125240963  即可获取数十套PDF哦!

Python爬虫入门!破解pexels高清原图!零基础必学教程!

Python爬虫入门!破解pexels高清原图!零基础必学教程!

Python爬虫入门!破解pexels高清原图!零基础必学教程!

查看源代码首页差不多,接着是图片真实地址链接。我在这里绕了几个弯,具体不叙述。

加上前面pixabay的坑,最后得到经验:直接点击官方下载按钮,从对话框中看到图片真实链接,这是最保险的模式。(因为有时“查看模式”并不能提供真实链接,而且有时也并不能下载得到。)

Python爬虫入门!破解pexels高清原图!零基础必学教程!

我第一次以为链接只有第二种,结果辛辛苦苦匹配正则下载的图确是这样的:

Python爬虫入门!破解pexels高清原图!零基础必学教程!

有些图并不能打开,又得到教训:爬虫爬下的图打不开时,可能链接地址是错的。

Python爬虫入门!破解pexels高清原图!零基础必学教程!

Python爬虫入门!破解pexels高清原图!零基础必学教程!

Python爬虫入门!破解pexels高清原图!零基础必学教程!

每个链接后面都多了个’?’,如何去掉字符串最后一位字符,我记得string类是没有像list类的pop()方法的,又考验Python基础。不过这个简单啦~

Python爬虫入门!破解pexels高清原图!零基础必学教程!

点击源码中href=”/search/water/?page=2”,页面跳转

Python爬虫入门!破解pexels高清原图!零基础必学教程!

地址栏里链接变成 https://www.pexels.com/search/water/?page=2

熟悉的感觉,这几个图好像刚刚那个页面也出现过。。。

回第一页源码中数了下,一共才发现15张缩略图链接

然后全明白了,回page1一数正好吻合。

原来获取图片接口在源码里啊,每一页15张,308就是最大页数了。

接着就简单了,又可以循环遍历,避开瀑布流啦^_^

试着下载图片,结果又出幺蛾子了:

Python爬虫入门!破解pexels高清原图!零基础必学教程!

Python爬虫入门!破解pexels高清原图!零基础必学教程!

二、结果

最后来看下结果

已经存在的图自动跳过。

Python爬虫入门!破解pexels高清原图!零基础必学教程!

Python爬虫入门!破解pexels高清原图!零基础必学教程!

强迫症患者,终于等到10页图全部下载完才睡。。。

本来准备随便拿个图看效果

结果太大了上传不了。。。。

(比如上图第一排最右边的那个图就有27M)

Python爬虫入门!破解pexels高清原图!零基础必学教程!

三、代码

Python爬虫入门!破解pexels高清原图!零基础必学教程!

这个爬虫还是可以的,就是速度太慢了了,等学了多线程再回来优化。

总结

以上是编程之家为你收集整理的Python爬虫入门!破解pexels高清原图!零基础必学教程!全部内容,希望文章能够帮你解决Python爬虫入门!破解pexels高清原图!零基础必学教程!所遇到的程序开发问题。


如果您也喜欢它,动动您的小指点个赞吧

除非注明,文章均由 laddyq.com 整理发布,欢迎转载。

转载请注明:
链接:http://laddyq.com
来源:laddyq.com
著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。


联系我
置顶