Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例在我们学习的过程中，打开一个网站就想抓一次数据，但是并不是所有的

在我们学习的过程中，打开一个网站就想抓一次数据，但是并不是所有的网站都可以用一种方式抓到数据的，有的是网页结构特殊，有的是json数据包不一样，慢慢的写一些自己在抓站过程中遇到的奇特的网站，分享思路和抓取方法给大家！

工具、目标\

工具：pycharm、python3.6版本

库：requests库

目标：谱时网热门图片直播页面，所有的图片信息

说明：该网站有热门图片页面，里面有活动的相关照片，按活动将所有的图片信息写入txt文档（不下载图片，是为了不对服务器造成影响）！

目标分析\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

首先，如上图打开主页，其它的不用管，直接点击右上角，出现选项后，点击进入热门图片直播选项（注意：有的浏览器要缩放页面，才可以看到热门图片直播的选项），进入后页面如下所示\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

这里我是缩放到了30%，下方呢，就是一个个的活动图片直播的页面了。#价位@762459510 免费领取python、爬虫配套实操资料#随便点开一个活动，我们看看页面\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

看页面的图片加载这么慢，应该是动态加载的，右键查看源代码，果不其然！\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

没有任何的图片信息，那么我们就需要用到浏览器的页面审查工具了！我这里用的是火狐浏览器，摁F12就可以打开，然后点击网络，清除内容，刷新页面，看看它加载了什么数据进来\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

简单查看后，发现了2个包含有我们要的数据\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例 \

一个是活动相关信息，一个是图片相关信息，都是json格式加载的，这样就简单了，请求相关url就可以获取到，这时忽然想到，如果之前的多个活动页面也是动态加载的，那么是否可以通过这种方式将所有的活动也抓到呢？来看看\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

这个json数据中，存在了所有的页面加载的活动信息！没有翻页。。。怪不得加载那么慢呢[手动委屈]。\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

代码实现\

通过上述的分析，我们明白了目标数据所在的位置，那么就可以开始试着写代码了

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

导入requests库，然后直接请求真实网址，获得name和对应的url（真实网址在消息头中），然后构建页面中的真实网址，上面所拿到的url其实是网页的url，并不是该网页的json包所在的真实地址，怎么拿到真实地址呢？我们多拿几个获得页面的真实网址对比，不难发现它的规律\

wx.plusx.cn/activity/li…

wx.plusx.cn/activity/li…

wx.plusx.cn/activity/li…

wx.plusx.cn/activity/li…

对比下就发现，其实就是activityNo的值不一样而已，而这个值在上述抓到的json包里也是存在的！

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

构建下一页的真实请求地址，然后抓json包，获取所有图片url！至此，核心代码已经写完，将它完善一下，整体代码和效果如下：\

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例 \

不到1分钟，该页面全部的活动及活动图片url保存完毕，整体代码也不到20行，很简单的一个网站！如果要下载图片，可以将url全部复制到下载工具中，批量下载哦！\最后，如果你的时间不是很紧张，并且又想快速的提高，最重要的是不怕吃苦，建议你可以价位@762459510 ，那个真的很不错，很多人进步都很快，需要你不怕吃苦哦！大家可以去添加上看一下~

Python爬虫，哪些奇特的网站值得一爬！谱时网爬虫实例

后记\

这个网站的整体结构比较清晰，数据也很简单就获取了，而今天之所以拿这个网站来分享，是因为开始抓包的时候，自己都不敢相信，一个页面之间加载了400多张图片。。。而且看页面结构也没想到有这么简单！

总的来说，该网站比较适合新手去学习抓包获取数据，希望能帮助到大家，加油！