Crawl4AI 快速上手:5 分钟拿到可进模型的网页数据

发布时间:2026/8/29 9:30:06

Crawl4AI 快速上手:5 分钟拿到可进模型的网页数据
Crawl4AI 快速上手5 分钟拿到可进模型的网页数据【免费下载链接】crawl4ai Crawl4AI: Open-source LLM Friendly Web Crawler Scraper. Dont be shy, join here: https://discord.gg/jP8KfhDhyN项目地址: https://gitcode.com/GitHub_Trending/craw/crawl4ai一条命令把网页变成干净 Markdown不用注册服务、不用 API 密钥。写完第一个脚本 30 秒后内容就能直接喂给 LLM 或数据管道。这就是 Crawl4AI一个面向 LLM 场景的开源网页爬虫做的事很直接抓取网页转成结构化文本。安装并验证环境装包加初始化两条命令pip install -U crawl4ai crawl4ai-setupcrawl4ai-setup会顺带装好 Playwright 浏览器。装完跑一行验证crawl4ai-doctor跑通后你会看到逐项打勾的体检结果Python 版本、Playwright、浏览器路径全 OK。有缺失它会直接点名是哪个环节没装好。其他安装方式按需取用预发布版pip install crawl4ai --pre开发模式改源码clone 仓库https://gitcode.com/GitHub_Trending/craw/crawl4ai然后cd crawl4ai pip install -e .全量依赖pip install -e .[all]写一个能跑的最小爬虫这段脚本做的事起一个无头浏览器抓一个页面打印 Markdown 前 300 字符。import asyncio from crawl4ai import AsyncWebCrawler async def main(): async with AsyncWebCrawler() as crawler: result await crawler.arun( urlhttps://www.nbcnews.com/business ) print(result.success) print(result.markdown[:300]) if __name__ __main__: asyncio.run(main())跑完你会看到True和一段网页的 Markdown 正文。这就是 Crawl4AI 的核心价值网页到结构化文本是默认输出不是需要额外配置的功能。不想写 Python 也有捷径装完自带的crwl命令行可以直接抓crwl https://www.nbcnews.com/business -o markdown核心能力拆解把 Markdown 过滤成模型能读的正文原始 Markdown 带着导航栏、页脚、广告位白白吃 token。挂一个内容过滤器Crawl4AI 会按文本密度自动剪掉低价值块from crawl4ai import AsyncWebCrawler, CrawlerRunConfig, CacheMode from crawl4ai.markdown_generation_strategy import DefaultMarkdownGenerator from crawl4ai.content_filter_strategy import PruningContentFilter config CrawlerRunConfig( cache_modeCacheMode.BYPASS, markdown_generatorDefaultMarkdownGenerator( content_filterPruningContentFilter(threshold0.4) ), ) async with AsyncWebCrawler() as crawler: result await crawler.arun(https://en.wikipedia.org/wiki/Apple, configconfig) print(len(result.markdown.raw_markdown)) # 过滤前 print(len(result.markdown.fit_markdown)) # 过滤后两个数字相除通常能砍掉三四成。批量喂 LLM 做 RAG 时这一步直接省钱省延迟。用 CSS 选择器抽结构化数据整页正文太杂你只想要商品标题和价格。给爬虫配一个 CSS 选择器它就只保留选中的部分再进一步用 JSON 抽取策略直接产出结构化数据from crawl4ai import AsyncWebCrawler, CrawlerRunConfig, CacheMode, JsonCssExtractionStrategy schema { name: Items, baseSelector: div.item, fields: [ {name: title, selector: h2, type: text}, {name: link, selector: a, type: attribute, attribute: href}, ], } config CrawlerRunConfig( cache_modeCacheMode.BYPASS, extraction_strategyJsonCssExtractionStrategy(schema), ) async with AsyncWebCrawler() as crawler: result await crawler.arun(https://example.com/list, configconfig) print(result.extracted_content) # 一条 JSON 字符串页面结构稳定的列表页、商品页就适合走这条路零模型成本结果可复现跑一万页也不心疼。处理 JS 动态加载与滚动加载的页面内容要等点击才出现、要往下滚才渲染你拿到的第一版 HTML 就是残的。常见场景两个参数加一段脚本就够from crawl4ai import AsyncWebCrawler, CrawlerRunConfig, VirtualScrollConfig config CrawlerRunConfig( js_codedocument.querySelector(.load-more)?.click(), # 点一下加载更多 delay_before_return_html2, # 等内容落定再取 HTML virtual_scroll_configVirtualScrollConfig( container_selector#feed, scroll_count20, ), )其中virtual_scroll_config专治时间线这类「滚动时删掉旧内容」的虚拟滚动页面不配它你只能拿到视口里的几条。抓社交信息流、长数据表时必加。深度爬取整站 单页不够要沿链接把整站抓下来。一行策略配置按 BFS 广度优先爬深度、页数、域名边界都可控from crawl4ai import AsyncWebCrawler, CrawlerRunConfig from crawl4ai.deep_crawling import BFSDeepCrawlStrategy config CrawlerRunConfig( deep_crawl_strategyBFSDeepCrawlStrategy( max_depth2, # 往深处爬 2 层 include_externalFalse, # 不跳出当前域名 max_pages50, # 最多 50 页兜底 ), ) async with AsyncWebCrawler() as crawler: results await crawler.arun(https://example.com, configconfig) print(f共爬 {len(results)} 页)返回的是列表每页自带 Markdown 和深度等元数据。给 LLM 建站点级知识库就用它站点大时再挂一个 URL 评分器优先爬相关页面。排掉三个高频问题浏览器依赖缺失arun 直接报错。现象是抓任何页面都抛 Playwright 相关的异常原因是crawl4ai-setup没跑完或装浏览器时被中断。手动补装一次即可python -m playwright install --with-deps chromium装完原脚本直接能跑不用重装包。页面内容只出来一半。Markdown 里列表项断断续续多半是动态内容还没加载完就取了 HTML。把delay_before_return_html提到 2~3 秒或者用wait_for指定某个关键元素等真正的加载完成信号别盲目死等。被目标站点拦返回空内容或验证页。先换真实感强的user_agent再挂代理还不行就降并发、放慢频率from crawl4ai import BrowserConfig browser BrowserConfig( headlessTrue, user_agentMozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) ..., proxy_config{server: http://127.0.0.1:8080}, )大部分「被反爬」的错觉其实只是 UA 是裸 Playwright 暴露了身份。接下来往哪走深度爬取全貌docs/md_v2/core/deep-crawling.md过滤器链、URL 评分、崩溃恢复都在里面虚拟滚动完整文档docs/md_v2/advanced/virtual-scroll.mdLLM 抽取示例docs/examples/llm_extraction_openai_pricing.py定义一个 Pydantic 模型就能让 LLM 按结构吐数据当你需要把网站内容喂给 LLM——不管是搭 RAG 知识库、批量比价还是给 Agent 备料——Crawl4AI 把「抓页面、洗噪音、抽数据」压缩成了几行配置。剩下的就是挑个真实站点跑起来。【免费下载链接】crawl4ai Crawl4AI: Open-source LLM Friendly Web Crawler Scraper. Dont be shy, join here: https://discord.gg/jP8KfhDhyN项目地址: https://gitcode.com/GitHub_Trending/craw/crawl4ai创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

PaddleOCR:一条命令把PDF变成结构化数据

PaddleOCR:一条命令把PDF变成结构化数据

2026/8/29 9:30:06

PaddleOCR:一条命令把PDF变成结构化数据 【免费下载链接】PaddleOCR Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100 languages. 项目…

3步搭好Prompt Engineering学习站:从跑通到思维链实操的完整方案

3步搭好Prompt Engineering学习站:从跑通到思维链实操的完整方案

2026/8/29 9:30:06

3步搭好Prompt Engineering学习站:从跑通到思维链实操的完整方案 【免费下载链接】Prompt-Engineering-Guide 🐙 Guides, papers, lessons, notebooks and resources for prompt engineering, context engineering, RAG, and AI Agents. 项目地址: htt…

不锈钢焊管自动切割程序

不锈钢焊管自动切割程序

2026/8/29 9:30:06

切割机控制板 代码修改 单选框和双态按钮联动 beep 50 r1.val0 bt0.val1 bt0.txt"时间方式" printh C0 00 00 00 00 00 FA beep 50 r0.val0 bt0.val0 bt0.txt"位置方式" printh C0 01 00 00 00 00 FA if(bt0.val1) { //此时按键是按下的 bt0.txt"…

AI工程范式切换:从模型能力竞赛到智能体工作流落地

AI工程范式切换:从模型能力竞赛到智能体工作流落地

2026/8/29 10:30:09

过去一两年,很多人对人工智能的判断是“一条直线”:模型越大,能力越强;能力越强,应用自然越多。但最近一段时间的真实体感,不是线性增长,而是频繁出现的转折和重新定义。模型更新节奏在加快&…

具身智能与城市机器人试验场:从仿真到真机的系统工程

具身智能与城市机器人试验场:从仿真到真机的系统工程

2026/8/29 10:30:09

机器人要真正走进城市,并不只是“造一台更聪明的机器”那么简单。当一台具备感知、决策、自主移动能力的设备被放到真实街道、园区、楼宇和交通枢纽中,考验的就不再是某一个算法,而是从传感器、算力、通信到数据闭环的一整套系统工程。长沙正…

低功耗物联网组网实战:智能楼宇传感器部署与协议选型指南

低功耗物联网组网实战:智能楼宇传感器部署与协议选型指南

2026/8/29 10:30:09

做智能楼宇项目这几年,我越来越清楚地感受到,低功耗物联网(IoT)组网不是低成本替代品,而是真正决定项目能不能落地、能不能长期运行的关键。环境传感器、水电表、门锁、照明控制……这些看起来简单的点位,一…

AI Agent工具部署实战:OpenClaw、Hermes Agent与Buzz选型对比

AI Agent工具部署实战:OpenClaw、Hermes Agent与Buzz选型对比

2026/8/29 10:30:09

如果只看项目首页,2025 年的 AI Agent 工具一个比一个美好:一行命令安装,一个配置文件启动,支持钉钉、飞书、微信,还能接上 DeepSeek、本地模型、NVIDIA NIM。但真到动手部署那天,很多人会发现事情没有那么…

法国营销电话新规下的呼叫中心外呼合规改造与拦截技术解析

法国营销电话新规下的呼叫中心外呼合规改造与拦截技术解析

2026/8/29 10:30:09

最近法国宣布将禁止未经用户同意的主动营销电话,也就是常说的 unsolicited telemarketing calls。虽然这看起来是一条政策新闻,但它背后直接影响的是呼叫中心的外呼策略、号码标记体系、CRM/CTI 系统的同意管理逻辑,以及普通用户手机上的骚扰…

Proxmox VE + VDI-WEB 云桌面离线安装包更新指南

Proxmox VE + VDI-WEB 云桌面离线安装包更新指南

2026/8/29 10:20:09

如果你所在的生产环境是内网隔离网络,没有外网、没有可用的软件源缓存,只有一台 Proxmox VE 服务器和一套已经跑了大半年的平台,那么每次升级都是一次对运维习惯和备份意识的检验。很多团队在部署云桌面时优先选择 Proxmox VDI-WEB 组合&…

[光学原理与应用-521]:对光的错误理解与纠偏

[光学原理与应用-521]:对光的错误理解与纠偏

2026/8/27 11:10:02

首先光是一种能量的载体和形态,宏观上观察到的光是由无数个微观的光量子组成的,每个光子在产生的瞬间,其在真空的空间中以确定不变的速度沿着一个初始的方向一直向前,在微观层面,每个光量子的运动轨迹是以波函数所展现…

SIP通话转接原理与REFER方法实战解析

SIP通话转接原理与REFER方法实战解析

2026/8/29 10:22:10

1. 通话转接不是“挂断再拨号”,而是SIP会话的动态重定向你有没有遇到过这样的场景:客服坐席A正在和客户通电话,突然需要把这通对话无缝转给专家坐席B,客户完全感知不到中间的断连——既没听到忙音,也没被要求重新拨号…

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

Kolla-ansible单节点OpenStack部署实战:从环境准备到排坑指南

2026/8/28 7:34:42

1. 为什么选择Kolla-ansible来部署单节点OpenStack?如果你正在寻找一种能把OpenStack从“概念”快速变成“可用的实验环境”的方法,那么Kolla-ansible几乎是当前最主流、最省心的选择。我见过太多人卡在手动编译依赖、配置服务、处理版本冲突的泥潭里&am…

四款热门降AI工具测评:研究生和本科生怎么选?

四款热门降AI工具测评:研究生和本科生怎么选?

2026/8/29 0:09:39

马上要交论文了,最近真的被论文ai率折磨的够呛。 明明查重都没问题了,但是ai率就是居高不下,崩溃了,明明都是我自己写的,天杀的,明明都是我亲生的啊 改来改去,终于给我搞出一套完美的降ai方案…

论文降AI率免费攻略:自查、提示词与工具推荐

论文降AI率免费攻略:自查、提示词与工具推荐

2026/8/29 0:09:39

马上要交论文了,最近真的被论文ai率折磨的够呛。 明明查重都没问题了,但是ai率就是居高不下,崩溃了,明明都是我自己写的,天杀的,明明都是我亲生的啊 改来改去,终于给我搞出一套完美的降ai方案…

北京GEO优化服务商推荐:预算型企业如何选北京GEO优化服务商?

北京GEO优化服务商推荐:预算型企业如何选北京GEO优化服务商?

2026/8/29 0:09:39

前言:预算有限的企业更关心投入能否形成可持续的品牌资产。评估北京GEO优化服务商时,不能只比较单篇内容或单月报价,还要看是否能够把问题词、官网、信源和监测串成完整链路。本期重点放在预算配置、试点范围和交付边界,帮助企业先…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/28 7:35:26

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/28 7:34:51

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/28 7:34:35

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…