官方介绍

Scrapling 是一个**「会自己修复」的 Python 网页爬虫框架**,仓库 D4Vinci/Scrapling,85,104 星(Python 爬虫圈顶级),当前版本 0.4.15。它的核心卖点是自适应解析:普通爬虫靠 CSS/XPath 选择器,网站一改版就失效;Scrapling 在第一次抓取时记录元素的结构特征,之后即使选择器变了,也能靠结构相似度自动找回新位置,让爬虫继续运行。

核心功能

层能力说明
解析层自适应选择器网站改版后自动重新定位元素(auto_save / adaptive)
抓取层四种 FetcherFetcher(普通 HTTP)、AsyncFetcher(异步)、DynamicFetcher(执行 JS)、StealthyFetcher(隐身反爬,可绕 Cloudflare Turnstile)
爬虫层Spider 框架并发、多会话、断点续爬、代理轮换、按响应速度自动调速
生态附加能力Docker 镜像、CLI、自带 MCP 服务器(可接入 AI 工具直接调用)

使用说明

  1. 安装:pip install scrapling
  2. 基础用法:page.css('.product', auto_save=True) 首次抓取并记录特征;改版后 adaptive=True 自动重新定位
  3. 反爬场景:使用 StealthyFetcher(隐身模式),支持 headless 与 network_idle 参数
  4. 完整爬虫:继承 Spider 类,定义 start_urls 与 parse 方法
合规边界:技术上能绕过反爬不等于对方允许;抓取第三方网站前应确认其服务条款;规模化抓取通常需自备代理池。

官方链接