Crawl4AI是一款基于AI大语言模型能力的网络爬虫和数据抓取软件,可以将网页转换为简洁、符合 LLM 规范的 Markdown 格式,适用于 RAG、代理和数据管道。它速度快、可控性强。

Crawl4AI官方介绍
开源的 LLM 友好型网络爬虫和抓取工具。
Crawl4AI 将网页转换为简洁、符合 LLM 规范的 Markdown 格式,适用于 RAG、代理和数据管道。它速度快、可控性强,并经过超过 5 万名用户组成的强大社区的实战检验。
✨ v0.7.7 版本新增功能:完整的自托管平台,支持实时监控!企业级监控仪表盘、全面的 REST API、WebSocket 流媒体、智能浏览器池管理以及生产就绪的可观测性。全面掌控您的爬虫基础设施。
/crawl/job✨ 最新 v0.7.6 版本:完善的 Docker 作业队列 API Webhook 基础架构!支持所有端点的实时通知,/llm/job并具备指数退避重试机制、自定义请求头和灵活的发送模式。告别轮询!
✨ 上一版本 v0.7.5:Docker Hooks 系统,提供基于函数的 API 以进行流水线定制;增强了 LLM 与自定义提供程序的集成;支持 HTTPS 协议;并修复了多个社区反馈的错误
Crawl4AI特点
Markdown 生成
- 🧹 Clean Markdown:生成格式准确、结构清晰的 Markdown 文档。
- 🎯 Fit Markdown:基于启发式的过滤,去除噪声和无关部分,以便进行 AI 友好的处理。
- 🔗引文和参考文献:将页面链接转换为带有清晰引文的编号参考文献列表。
- 🛠️自定义策略:用户可以创建自己的 Markdown 生成策略,以满足特定需求。
- 📚 BM25 算法:采用基于 BM25 的过滤方法来提取核心信息并去除无关内容。
结构化数据提取
- 🤖 LLM 驱动提取:支持所有 LLM(开源和专有)进行结构化数据提取。
- 🧱分块策略:实施分块(基于主题、正则表达式、句子级别)以进行有针对性的内容处理。
- 🌌余弦相似度:根据用户查询查找相关的内容块,以进行语义提取。
- 🔎基于 CSS 的数据提取:使用 XPath 和 CSS 选择器快速提取基于模式的数据。
- 🔧模式定义:定义自定义模式,用于从重复模式中提取结构化 JSON。
浏览器集成
- 🖥️管理型浏览器:使用用户拥有的浏览器,完全控制,避免被机器人检测。
- 🔄远程浏览器控制:连接到 Chrome 开发者工具协议,用于远程、大规模数据提取。
- 👤浏览器分析器:创建和管理具有已保存身份验证状态、cookie 和设置的持久配置文件。
- 🔒会话管理:保存浏览器状态并将其重用于多步骤爬取。
- 🧩代理支持:无缝连接代理服务器,并通过身份验证实现安全访问。
- ⚙️完全浏览器控制:修改标头、cookie、用户代理等,以实现定制化的爬虫设置。
- 🌍多浏览器支持:兼容 Chromium、Firefox 和 WebKit。
- 📐动态视口调整:自动调整浏览器视口以匹配页面内容,确保所有元素的完整渲染和捕获。
爬取与抓取
- 🖼️媒体支持:提取图像、音频、视频和响应式图像格式,例如
srcset和picture。 - 🚀动态爬取:执行 JS 并等待异步或同步以提取动态内容。
- 📸屏幕截图:在爬取过程中捕获页面屏幕截图,以便进行调试或分析。
- 📂原始数据爬取:直接处理原始 HTML (
raw:) 或本地文件 (file://)。 - 🔗全面链接提取:提取内部链接、外部链接和嵌入式 iframe 内容。
- 🛠️可自定义钩子:在每个步骤定义钩子以自定义爬取行为(支持基于字符串和函数的 API)。
- 💾缓存:缓存数据以提高速度并避免重复获取。
- 📄元数据提取:从网页中检索结构化元数据。
- 📡 IFrame 内容提取:从嵌入式 iframe 内容中无缝提取。
- 🕵️延迟加载处理:等待图像完全加载,确保不会因延迟加载而丢失任何内容。
- 🔄全页扫描:模拟滚动以加载和捕获所有动态内容,非常适合无限滚动页面。
Crawl4AI整合包使用说明
首先将网盘内的软件压缩包下载到本地电脑上并解压。
双击启动软件.bat,稍等一会就会打开webui操作界面
操作界面做的比较简单,主要做了html转markdown和数据查询功能,但是Crawl4AI本身功能很复杂很强大,后续我还会继续丰富支持的功能
输入URL链接,点击网页转Markdown即可将网页保存为.md格式文档
输入URL链接和任务内容描述,即可在给定的URL及关联URL中查找任务描述内容,结果返回查找内容所在的URL。当前默认快速查找模式,只适合精确匹配内容的知识库类内容查找。AI模式可根据AI的分析智能查找相关内容,无需精确匹配页面关键词,还在优化中暂时未开放。
后台模式控制是否显示执行任务的浏览器窗口
视频教程及效果演示:
注意事项
整合包只支持windows 10和11
Crawl4AI网络爬虫和数据抓取工具整合包下载链接
Crawl4AI在线一键启动版
相关推荐
免费网络爬虫软件EasySpider下载,网页数据采集抓取工具
PDF转Markdown软件MinerU 3.1.11整合包(高性能版)
腾讯混元三维世界重建系统WorldMirror 2.0通用3D三维资产重建工具下载
PDF转word软件FreeP2W免安装版下载
图片/PDF转HTML/Markdown/JSON软件Chandra—— Windows 版一键启动包,免安装部署,可离线
openclaw AI助手windows电脑安装部署及微信聊天配置详细教程
Apple苹果3D 高斯(3DGS)模型ply文件生成器,图片转3D模型软件下载
字节跳动Dolphin图片文档解析工具免安装一键启动整合包下载,PDF转JSON/Markdown软件
最近更新
PDF转Markdown软件MinerU 3.1.11整合包(高性能版)
MinerU是一款非常热门的PDF、图片、DOCX、PPTX、XLSX转markdown格式软件,转换效果属于同类软件中比较优秀的一个。当前最新版为3.1.11版本,我基于最新版源码制作了免安装一键启动整合包,并做适当优化及修改,详情查看链...
阿里千问Qwen3-TTS声音克隆语音合成软件【低配电脑版】
阿里千问Qwen3-TTS是一款热门的语音合成及声音克隆软件,我基于当前最新版制作了免安装一键启动整合包,并增加多人对话语音合成功能。 此版本为低配显卡电脑版,软件使用0.6B模型,模型尺寸略小,对电脑显卡配置要求也更小,但是质量不会差太多...

腾讯混元三维世界重建系统WorldMirror 2.0通用3D三维资产重建工具下载
WorldMirror 2.0 是由腾讯混元(Hunyuan)团队开发的下一代通用三维世界重建系统,底层基于 HY-World-2.0 模型。它能够从一组普通照片或一段视频中,自动恢复出场景的三维结构,并生成多种形式的三维资产,包括: 我基...

阿里Qwen3-TTS高质量声音克隆语音合成系统,AI视频配音多人对话生成工具
Qwen3-TTS 是由阿里 Qwen 团队开发的新一代语音合成系统,基于自研的 Qwen3-TTS-Tokenizer-12Hz 编解码器和离散多码本 LM 架构,实现了端到端的全信息语音建模。它突破了传统级联架构的信息瓶颈,支持音色克隆...

PasteMD:一键将 Markdown 和网页 AI 对话文本内容粘贴到 Word、WPS 和 Excel
PasteMD:一键将 Markdown 和网页 AI 对话(ChatGPT/DeepSeek等)完美粘贴到 Word、WPS 和 Excel 的效率工具。 在写论文或报告时,从 ChatGPT / DeepSeek 等 AI 网站中复制出...

BiliNote:自动生成B站油管视频笔记,AI视频内容总结工具
在信息爆炸的时代,视频已经成为最重要的知识载体之一。但相比文字,视频的“可检索性”和“复用效率”始终较低。如何快速从长视频中提取重点、形成结构化知识,成为很多学习者和创作者的痛点。 而 BiliNote 正是为解决这一问题而诞生的一款开源 ...

优云智算HappyHorse AI 视频生成API KEY WebUI
大家可能平常刷视频的时候已经发现了,进入2026年AI短剧极其火爆,不管是短视频平台还是拼多多等购物平台,短剧视频里经常能刷到AI漫剧。前几年短剧公司拍真人短剧赚的盆满钵满,进入2026年短剧公司被AI打的毫无还手之力。借助AI的快速发展,...

LTX-2.3 视频生成免安装部署整合包软件下载
LTX-2 是由 Lightricks 开发的首个基于 DiT(扩散变换器)架构的音视频基础模型,能够在一个统一模型中同时生成高质量的视频与同步音频。与以往需要分别处理视频和音频的方案不同,LTX-2 将两者深度融合,实现真正的音画同步生成...
windows电脑剪贴板内容管理工具Ditto下载,快速粘贴预设文字内容回复话术
和大家分享一个windows电脑剪贴板内容管理神器Ditto,软件可以快速将预设文字内容填充到指定位置。 由于每天都要写大量文字,有时候还是重复内容,频繁到其它地方复制粘贴的话比较耗时间,所以找到了这款软件,首先佩服一下软件作者,这个软件维...
PDF转word软件FreeP2W免安装版下载
这软件还是很早的时候一个用户让做的,发现没分享过,现在分享一下。 软件主要功能就是把PDF文档转换为word文档 软件使用很简单,把需要处理的pdf文档复制到input文件夹内,双击启动软件.exe,等待处理完成即可。 注意事项 软件只支持...











