(第1条)什么是Spider?
一种蜘蛛,是一种按一定规则自动抓取互联网信息的程序或者脚本.
(第2条)它的工作原理是什么?
核心逻辑: 种子启动-循环爬行-终止退出
从一个起点网址出发,顺着连接不断往下点,直到没有新网页可看为止.
(第3条) 爬虫的分类
1.通用爬虫: 百度,谷歌,他们抓取的对象是整个互联网 2.垂直爬虫:单一网站,比如今日头条
(第4条) 什么是robots协议?
网址末尾加上robots.txt
例如:百度的robots协议
1.User-agent:爬虫名称 2.Disallow:不允许爬虫的访问地址 3.ALLow:允许爬虫的地址
(第5条) 网页数据的展示
1.服务器渲染的静态页页面请求,网页源码. 2.客户渲染,ajax接口
(第6条) 我们一些常用的参数
Request URL: 请求连接
Request Method: 请求方式,常用两种
1.GET 请求指定的页面信息,并返回实体主体. 2.POST 向指定资源提交数据进行处理请求,数据被包含在请求中,返回相关数据:POST请求可能会导致新的资源的建立和/或者已经一样的资源修改.
Status Code : 状态码
1.200 2.202 3.302 4.400 5.403 6.500
(第7条)User-Agent的作用是什么?
简单回答就是自我介绍,告诉网站我是谁,我用啥设备来,浏览器来的
UA都有那些信息,看一串字符串:
Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0 Safari/537.36
1.Mozilla/5.0------兼容Mozilla (就是几乎所有的浏览器都带这个开头,是为了兼容老网站) 2.Windows NT 10.0 ------就是我用的Windows系统 3.Chrome/120.0 -------就是我用的Chrome浏览器
人家一看,来了一个Windows+Chrome的真人.
但是不能访问过多,容易被封IP,弹什么验证码这些,直接拒绝,那么该怎么解决这个问题,就是找现成UA字符串直接用
1.GitHub上搜 User-Agent list,有专门的仓库收集有几千条的 2.各种技术博客,爬虫教程里面也会贴一堆的 3.有字符串是不够的,你得让整组请求头像真人 4.多备几个马甲,UA只是辅助,主要是不要太贪心
(第8条)curl 转 Python 到底有啥好处
url 转 Python 的最大好处 = 把"手写一堆复杂的请求头"这件事,从 5 分钟手搓出错,变成 5 秒复制搞定。
它是爬虫调试的"抄作业神器",帮你省时间、少出错、快速跑通。