爬虫认知提升(1)

0 阅读2分钟

(第1条)什么是Spider?

一种蜘蛛,是一种按一定规则自动抓取互联网信息的程序或者脚本.

(第2条)它的工作原理是什么?

核心逻辑: 种子启动-循环爬行-终止退出

从一个起点网址出发,顺着连接不断往下点,直到没有新网页可看为止.

(第3条) 爬虫的分类

1.通用爬虫: 百度,谷歌,他们抓取的对象是整个互联网 2.垂直爬虫:单一网站,比如今日头条

(第4条) 什么是robots协议?

网址末尾加上robots.txt

image.png

例如:百度的robots协议

image.png

1.User-agent:爬虫名称 2.Disallow:不允许爬虫的访问地址 3.ALLow:允许爬虫的地址

(第5条) 网页数据的展示

1.服务器渲染的静态页页面请求,网页源码. 2.客户渲染,ajax接口

(第6条) 我们一些常用的参数

Request URL: 请求连接

Request Method: 请求方式,常用两种

1.GET 请求指定的页面信息,并返回实体主体. 2.POST 向指定资源提交数据进行处理请求,数据被包含在请求中,返回相关数据:POST请求可能会导致新的资源的建立和/或者已经一样的资源修改.

image.png

Status Code : 状态码

1.200 2.202 3.302 4.400 5.403 6.500

(第7条)User-Agent的作用是什么?

简单回答就是自我介绍,告诉网站我是谁,我用啥设备来,浏览器来的

UA都有那些信息,看一串字符串:

Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0 Safari/537.36

1.Mozilla/5.0------兼容Mozilla (就是几乎所有的浏览器都带这个开头,是为了兼容老网站) 2.Windows NT 10.0 ------就是我用的Windows系统 3.Chrome/120.0 -------就是我用的Chrome浏览器

人家一看,来了一个Windows+Chrome的真人.

但是不能访问过多,容易被封IP,弹什么验证码这些,直接拒绝,那么该怎么解决这个问题,就是找现成UA字符串直接用

1.GitHub上搜 User-Agent list,有专门的仓库收集有几千条的 2.各种技术博客,爬虫教程里面也会贴一堆的 3.有字符串是不够的,你得让整组请求头像真人 4.多备几个马甲,UA只是辅助,主要是不要太贪心

(第8条)curl 转 Python 到底有啥好处

url 转 Python 的最大好处 = 把"手写一堆复杂的请求头"这件事,从 5 分钟手搓出错,变成 5 秒复制搞定。

它是爬虫调试的"抄作业神器",帮你省时间、少出错、快速跑通。