有时候我们只是想把某个网页上的数据抠下来喂给 AI,结果上网一搜,全是按月收费的商业爬虫。有些甚至连价格都不标,非要你留个电话邮箱,等销售慢吞吞地来联系你。
其实真没必要。在 GitHub 上,早就有一大批免费、开源的工具能干这事,开箱即用,根本不用等任何人审批。
今天我整理了 10 个非常实用的开源项目,涵盖了网页、本地文件、手机 App 等各种数据源。我不吹捧它们,只说大实话,讲清楚每个工具适合什么场景、有什么坑,帮你省去筛选的时间。
严格来说,把它们全叫作“爬虫”并不准确。这其中有不碰网页的文档转换器,也有直接控制手机的工具。它们的核心价值,是把散落在各处、格式混乱的数据整理干净,再交到大模型手里。
01 Firecrawl:输入网址,直接吐出干净的 Markdown
如果你试过自己写爬虫去抠那些 JS 动态加载的网页,你就会知道 Firecrawl 有多救命。它在 GitHub 上已经有 1.4 万个 Star 了。
它的用法很简单:你给它一个网址,它会把整站的每一页都渲染好。即便是那些高度依赖 JavaScript 动态加载的页面,它也能轻松处理,最后吐给你一份非常干净、适合 AI 直接阅读的 Markdown 或结构化数据。
你不需要自己去写解析规则,也不用去处理繁琐的分页和动态加载,一个 API 搞定所有。
不过,用它之前得注意它的开源协议。Firecrawl 采用的是 AGPL-3.0 协议,具有一定的传染性。如果你打算把它的自托管版本集成到自己的商业产品中,按照协议,你的这部分代码也需要开源。如果是个人研究或团队内部自己用,那就无所谓。
02 Crawl4AI:零成本本地运行的“平替”
如果你在找一个完全免费、适合在自己电脑上跑的 Firecrawl 替代方案,Crawl4AI 是个很不错的选择。
它的功能和 Firecrawl 非常像,主要任务就是把网页转化为对大模型友好的 Markdown 格式。它的优势在于完全本地化,不需要注册账号,不需要 API Key,更不会按页收费。
而且 Crawl4AI 采用的是 Apache-2.0 协议,比 AGPL 宽松得多,商用时的法务风险小很多。
如果你不想折腾复杂的本地环境,愿意花点钱换取稳定的云端服务,选 Firecrawl;如果你想完全掌控数据,不想产生任何持续性费用,Crawl4AI 是个非常靠谱的起点。
03 MarkItDown:微软出品的文档“翻译官”
爬下来一堆 PDF、Word、Excel,大模型读不懂怎么办?微软这个工具就是专门用来把各种杂牌格式统一“翻译”成 Markdown 的。
严格来说,MarkItDown 不是一个网页爬虫,而是一个格式转换器。它能把 PDF、Word、Excel、PPT,甚至是带有 OCR 的图片和音频,统一转换成干净的 Markdown 文本。
在实际的数据处理流程中,我们经常会遇到大模型无法直接读取原始格式文件的问题。MarkItDown 解决的就是这“最后一公里”的清洗工作。
它采用宽松的 MIT 协议,由微软官方维护,非常适合作为你数据处理管道中的清洗环节。
04 Scrapy:2008 年的老古董,但依然是工业级霸主
拥有超过 6.3 万个 Star 的 Scrapy,是爬虫界毫无争议的元老。
相比于近几年针对 AI 优化的新工具,Scrapy 早就为各种专业数据团队服务了十几年。它的定位非常明确:Python 工业级大规模数据抓取。
当你需要爬取数百万个页面、处理复杂的并发请求、规整地导出数据,并且需要系统稳定运行几天甚至几周时,那些新潮的 AI 工具大概率会崩,而 Scrapy 的工程底蕴就体现出来了。它采用 BSD 协议,适合承载重型、长期的抓取任务。
05 Crawlee:JS/TS 程序员的专属武器库
如果你的技术栈是 JavaScript 或 TypeScript,那 Crawlee 就是你的首选。
它内置了代理轮换、自动重试、浏览器指纹伪装和请求队列管理等功能,几乎把应对反爬虫的工具都配齐了。
它支持 Puppeteer、Playwright 和 Cheerio,你可以根据需要自由切换是否启用真实的浏览器窗口。它由专业的爬虫托管公司 Apify 维护,采用 Apache 协议,代码质量非常扎实。
06 browser-use:让 AI 像真人一样去点浏览器
传统的爬虫是通过发送 HTTP 请求来获取 HTML 源码。但现在的网站防爬越来越严,各种登录、滑动验证码、必须点击才能加载的表单,传统爬虫根本进不去。
browser-use 的做法是直接让 AI Agent 来控制浏览器。
它能像真人一样看懂网页,自己去点击、输入和跳转,从而把那些藏在深处的动态数据捞出来。它采用 MIT 协议,非常适合处理那些交互复杂、传统爬虫难以渗透的网站。
延伸实战:拿到素材后,如何让 Agent 直接闭环生产内容?
既然 Agent 已经能帮我们搞定复杂的浏览器交互了,那在内容生产这个领域,能不能让 Agent 直接闭环?比如,把我们抓到的素材,直接变成能发在小红书上的图文?
这里分享一个可以实际安装和使用的案例——红鸦小红书图文 Skill(标识为 redya-xiaohongshu)。它由红鸦 AI 提供,可以无缝集成到 WorkBuddy、Codex、Claude Code、Cursor 等主流 Agent 工具中。
这个 Skill 的核心能力在于,当你给它一个主题时,它不仅能帮你生成小红书风格的标题和正文,还能自动规划每一页图片的视觉提示词,并直接批量生成整套的高清图文。它支持普通图文、知识型图文以及商品带货图文。如果你在做电商,还可以上传商品资料创建商品档案,让 AI 关联档案进行创作,甚至支持一次处理多个图文任务。
你可以通过其 GitHub 仓库了解更多技术细节:
https://github.com/rnthking/redya-skills
装好后我要用它生成小红书图文笔记。
安装完成后,你就可以在 Agent 中直接调用这个 Skill 了。
第一种方式是分步调用:你可以让 Agent 先输出大纲,包括标题、正文和每一页的图片提示词。等你检查并微调满意后,再让它执行批量出图。这种方式更适合对内容质量要求极高的精细化运营。
第二种方式是一句话直接出图:如果你不需要中间确认,可以直接输入你的创作主题,让 Agent 默默在后台把文案和整套配图一次性全部生成出来。
除了在 Agent 终端里用命令行交互,红鸦 AI 也提供了网页端可视化界面。如果你更习惯用鼠标点击和直观的输入框,可以直接打开网页端,在界面里输入主题,修改文案,然后一键批量生成图片。
对于做带货或种草的创作者,网页端还支持商品图文模式。你可以先在后台建立商品档案,上传真实的商品图片。这样在生成小红书图文时,AI 就会参考这些真实图片进行排版和渲染,避免出现画面与商品信息对不上的尴尬情况。
值得一提的是,Agent 终端和网页端使用的是同一个红鸦账号和积分系统。你在终端里让 Agent生成的内容,同样会保存在网页端的“我的创作”历史记录中,方便你随时下载、修改或二次编辑。
如果你习惯在 Cursor 或 Claude Code 等开发环境中直接调用,可以按照上面的指令安装 redya-xiaohongshu 这个 Skill;如果你更喜欢直观的视觉编辑,直接使用红鸦 AI 网页端即可。
07 Scrapling:不怕网页改版的自适应爬虫
写过爬虫的人都懂这种痛:你花了大半天写好了解析规则,结果第二天对方网站改版,DOM 结构一变,你的爬虫立刻报错停摆。
Scrapling 主打的就是“自适应”能力。当页面结构发生轻微变化时,它能通过内置的智能算法自动识别并跟上变化,减少了后期人工维护的成本。同时,它也做了一系列防检测优化,降低了被网站风控拦截的概率。它采用 BSD 协议,适合那些需要长期运行、但又懒于频繁维护的爬虫项目。
08 AutoScraper:给个样本,自动推导抓取规律
你不需要去研究复杂的 CSS 选择器或 XPath。你只需要给它一个你想要的网页数据样本(比如某个商品的标题或价格),它就会自己去推导整个页面的排版规律,把类似的数据全部提取出来。
不过需要提醒的是,该项目在 GitHub 上的最后一次代码提交停留在 2025 年 6 月左右,目前处于接近半停更的状态。因此,建议将它用于临时的小脚本或快速原型开发,不建议放入对稳定性要求极高的生产环境。
09 curl-impersonate:深度伪装的底层请求工具
现在的很多大型网站在防爬方面做得非常严格,它们不仅看你的 User-Agent,还会通过 TLS 指纹来识别请求是不是由真实的浏览器发出的。
curl-impersonate 是一个修改版的 curl,它能把底层的 TLS 握手特征伪装得和 Chrome、Firefox 一模一样,从而绕过很多高难度的防火墙拦截。
需要注意的是,原仓库的更新频率已经明显放缓。如果你在实际开发中需要用到这个技术,社区目前更推荐使用它的活跃替代品 curl_cffi,它在保持相同伪装能力的同时,维护状态更加健康。
10 scrcpy:打破网页限制,直接连接安卓手机
最后压轴的 scrcpy 拥有超过 14.5 万个 Star,是开源社区里名气极大的项目。
严格来说,它和普通爬虫毫无关系。它的本职工作是安卓投屏与控制,能让你在电脑上用极低的延迟、极高的画质去操作一台通过 USB 或 Wi-Fi 连接的安卓手机,而且不需要手机获取 Root 权限。
但为什么它会出现在 AI 数据连接器的清单里?
因为在移动互联网时代,有大量的核心数据根本没有网页版,它们只存在于手机 App 内部(比如你想扒某红书 App 里的笔记数据,网页端又查不到)。
当传统网页爬虫无能为力时,你可以通过 scrcpy 将手机界面投射到电脑上,再配合自动化脚本或视觉大模型,去读取和交互那些 App 内部的数据。它为你打开了一扇传统爬虫永远无法触及的数据大门。
总结:别盲目跟风,按需选择
面对这么多开源工具,没必要盲目地全部收藏,根据具体的业务场景来挑选即可:
- 想要省心、直接拿结构化数据:首选 Firecrawl。
- 不想花钱、想在本地运行:选择 Crawl4AI。
- 需要清洗本地的 PDF、Word 等杂乱文档:使用微软的 MarkItDown。
- 面对超大规模、需要跑几天的重型任务:老牌的 Scrapy 依然是最稳妥的选择。
- 需要让 AI 自动化操作浏览器、处理复杂交互:尝试 browser-use。
- 需要自动化生产小红书等渠道的图文内容:可以直接配置和使用 红鸦小红书图文 Skill。
别盲目跟风,写小脚本用 AutoScraper 玩玩就行;真要给公司做商业项目,老老实实去用 Scrapy 或者付费买 Firecrawl 的服务,别在开源协议上踩雷。挑一两个上手试一试,你会发现获取数据的门槛其实并没有想象中那么高。