python爬虫，学习路径拆解及资源推荐（第四篇：反爬及应对措施）( 想要学习Python？Python学习交流群：10

本文的文字及图片来源于网络,仅供学习、交流使用,不具有任何商业用途,版权归原作者所有,如有问题请及时联系我们以作处理

以下文章来源于腾讯云作者：昱良

( 想要学习Python？Python学习交流群：1039649593，满足你的需求，资料都已经上传群文件流，可以自行下载！还有海量最新2020python学习资料。 ) 在这里插入图片描述

爬虫像一只虫子，密密麻麻地爬行到每一个角落获取数据，虫子或许无害，但总是不受欢迎的。

因为爬虫技术造成的大量IP访问网站侵占带宽资源、以及用户隐私和知识产权等危害，很多互联网企业都会花大力气进行“反爬虫”。

你的爬虫会遭遇比如被网站封IP、比如各种奇怪的验证码、userAgent访问限制、各种动态加载等等。

常见的反爬虫措施有：

·通过Headers反爬虫

·基于用户行为反爬虫

·基于动态页面的反爬虫

·字体反爬

.....

遇到这些反爬虫的手段，当然还需要一些高级的技巧来应对，控制访问频率尽量保证一次加载页面加载且数据请求最小化，每个页面访问增加时间间隔；

禁止cookie可以防止可能使用cookies识别爬虫的网站来ban掉我们；

根据浏览器正常访问的请求头对爬虫的请求头进行修改，尽可能和浏览器保持一致等等。

往往网站在高效开发和反爬虫之间会偏向前者，这也为爬虫提供了空间，掌握这些应对反爬虫的技巧，绝大部分的网站已经难不到你了。在这里插入图片描述