首页
沸点
课程
数据标注
HOT
AI Coding
更多
直播
活动
APP
插件
直播
活动
APP
插件
搜索历史
清空
创作者中心
写文章
发沸点
写笔记
写代码
草稿箱
创作灵感
查看更多
登录
注册
网络技术
亿牛云爬虫专家
创建于2023-02-22
订阅专栏
各种网络技术问题的讨论和资料
等 1 人订阅
共497篇文章
创建于2023-02-22
订阅专栏
默认顺序
默认顺序
最早发布
最新发布
2026架构前沿:将Declarative Crawler(声明式爬虫)引入你的技术栈
这篇文档强调了2026年数据工程领域声明式爬虫架构的重要性。它通过分离业务意图和执行细节,降低跨部门协作门槛。文档介绍了爬虫代理技术,并通过Python代码示例展示了如何实现声明式会话组。
技术拆解:单页面应用(SPA)路由跳转后的数据抓取策略
这篇文档讨论了单页应用(SPA)数据抓取的挑战。SPA数据由JS生成,传统爬虫无法有效抓取。解决方案包括复现接口和浏览器自动化渲染,关键是保持会话和IP一致性。
爬虫实战:如何优雅地抓取网页中隐藏在伪元素(::before)里的文本?
文章探讨了解决CSS伪元素导致文本抓取问题的方法。提出了直接采集接口、正则解析CSS和使用渲染引擎加代理IP三种解决方案。强调了处理返回值引号、警惕图片文字和不轻信attr()函数的重要性。
手把手带你用Python撸一个多线程+代理池下载器
这篇文章介绍了如何用Python标准库开发并发流媒体下载器,提高数据采集效率。主要方法包括构建代理字典、下载文件块和多线程下载合并。实战技巧包括设置超时、指数退避重试和合理使用代理IP。
谈谈长连接(Keep-Alive)在超大规模爬虫抓取中的性能差距
本文探讨了大规模爬虫中Keep-Alive技术的重要性和优化。Keep-Alive能显著提升性能,但需注意连接池耗尽等问题。建议使用高质量代理,合理配置参数,避免长时间使用同一IP。
实战:利用Playwright隐藏自动化特征(Stealth模式)的底层原理
文档概述了Playwright爬虫避免网站检测的策略,包括网站检测自动化工具的四层逻辑、stealth-patches解决方案、Stealth模式与动态代理结合的终极方案
深度对比:Scrapy vs PySpider,谁更适合作为企业级分布式底层?
讨论了Scrapy和PySpider两个Python爬虫框架的选型。Scrapy适合长期、高SLA的大规模爬虫系统,而PySpider适合中等规模、有可视化UI需求的团队。
别只盯着HTML了!教你高效抓取并解析PDF/Excel隐藏附件?
这篇文章讨论了从网页提取非标准数据的方法,包括发现附件链接、下载和命名策略、解析PDF和Excel、应对反爬机制,并提供了实战代码。同时,提醒检查合规性和合理设置请求间隔。
告别频繁崩溃与OOM:百万级Scrapy爬虫架构优化与代理实战
Scrapy爬虫优化:1. 启用JOBDIR减少重启;2. 集成代理管理;3. 配置407重试。效果:耗时减至35小时,内存3.5GB,成功率94%。
Python爬虫进阶:Playwright请求拦截(Request Interception)与动态代理IP实战
这篇文档介绍了如何利用Playwright的请求拦截功能开发高效、防屏蔽的爬虫。主要内容包括:1) 请求拦截的必要性;2) Playwright请求拦截机制;3) 实战代码演示;4) 其他注意事项
那些年我们踩过的坑:如何处理网页爬取中的中文字符集乱码(GBK/UTF-8)?
文章讨论了网页乱码问题,分析了编码不一致的原因,并提供了使用高质量代理和智能编码检测的解决方案及排查清单。
全面复盘:BeautifulSoup在处理大规模脏数据时的崩溃问题与解法
本文探讨了大规模脏数据处理中,如何有效使用Python的BeautifulSoup库,并提供解决方案。包括处理超大文档、中文乱码、解析器死循环和系统崩溃等问题,以构建高效、稳定的数据挖掘系统。
告别 403 与空数据!爬虫新手避坑指南:如何优雅地抓取 Ajax 异步加载数据
本文是爬虫新手指南,主要讨论如何避免403错误和获取Ajax异步加载数据。文章提供了实用的技巧和方法,帮助爬虫新手优雅地抓取数据,避免常见陷阱。
为什么说掌握了HTTP协议状态码,就解决了50%的爬虫报错
文章强调了HTTP状态码在爬虫中的重要性,提供了应对常见问题的解决方案。例如,使用代理IP绕过403和429状态码,以及对200状态码的二次校验。理解状态码对提高爬虫效率至关重要。
放弃 Scrapy 拥抱底层库?聊聊企业级爬虫技术选型的真实逻辑
企业常因需求多样性、代理复杂性、性能消耗、调试难度和团队交接问题,不选Scrapy框架,而倾向于使用requests等基础库构建爬虫。
从源码到生产:Scrapy 框架全生命周期与代理中间件实战全记录
简述了Python的Scrapy框架,用于构建高并发、分布式爬虫项目。讨论了Scrapy架构、引擎调度、并发控制,提供了开发企业级ProxyMiddleware的方法,强调了Scrapy的优势
如何优雅地搞定复杂 SPA 爬虫?Playwright 异步模式实战踩坑指南
文章讨论了使用Playwright异步模式和隧道代理解决SPA爬虫问题。介绍了Playwright的优势,如事件驱动DOM等待和自动等待机制,并提供了代码实现。强调了使用真实浏览器环境的重要性。
为什么你的爬虫跑着跑着内存就爆了?BeautifulSoup、Lxml与XPath的性能生死局
爬虫性能优化实战经验:文档分享了Python爬虫内存溢出问题、HTML解析器选择的重要性,比较了BeautifulSoup、Lxml和XPath的优缺点,并提出了选择解析器的三条铁律。
如果你天天用 requests.get(),请务必读懂这篇文章
这篇文章介绍了Requests库的架构、各层职责、核心步骤、代理使用和错误排查。理解Requests库机制对解决网络问题至关重要,提供了提高请求效率和稳定性的建议。
为什么我劝你放弃Selenium拥抱Playwright
建议优先使用Playwright,因其在启动速度、反爬、API设计、代理集成等方面优于Selenium。
下一页