官方介绍
Scrapling 是一个**「会自己修复」的 Python 网页爬虫框架**,仓库 D4Vinci/Scrapling,85,104 星(Python 爬虫圈顶级),当前版本 0.4.15。它的核心卖点是自适应解析:普通爬虫靠 CSS/XPath 选择器,网站一改版就失效;Scrapling 在第一次抓取时记录元素的结构特征,之后即使选择器变了,也能靠结构相似度自动找回新位置,让爬虫继续运行。
核心功能
| 层 | 能力 | 说明 |
|---|---|---|
| 解析层 | 自适应选择器 | 网站改版后自动重新定位元素(auto_save / adaptive) |
| 抓取层 | 四种 Fetcher | Fetcher(普通 HTTP)、AsyncFetcher(异步)、DynamicFetcher(执行 JS)、StealthyFetcher(隐身反爬,可绕 Cloudflare Turnstile) |
| 爬虫层 | Spider 框架 | 并发、多会话、断点续爬、代理轮换、按响应速度自动调速 |
| 生态 | 附加能力 | Docker 镜像、CLI、自带 MCP 服务器(可接入 AI 工具直接调用) |
使用说明
- 安装:
pip install scrapling - 基础用法:
page.css('.product', auto_save=True)首次抓取并记录特征;改版后adaptive=True自动重新定位 - 反爬场景:使用 StealthyFetcher(隐身模式),支持 headless 与 network_idle 参数
- 完整爬虫:继承 Spider 类,定义 start_urls 与 parse 方法