
CrawLoop:利用PlayWright和xvfb抓取JS渲染的动态网页,提供源码、截图、入口发现及网页互动等功能
5星
- 浏览量: 0
- 大小:None
- 文件类型:ZIP
简介:
CrawLoop是一款结合了PlayWright与xvfb的强大工具,专门用于抓取JavaScript渲染的动态网页。它不仅提供了页面源代码和截图功能,还支持入口发现和网页交互操作,极大地丰富了爬虫开发者的工具箱。
基于PlayWright实现对JS渲染的动态网页进行抓取,包含网页源码、截图、网站入口及网页互动过程等功能,并支持优先级任务调度。
Crawloop目前具备以下特性:
- 原生浏览器环境,兼容Chrome和Firefox;
- 协程处理调度任务;
- 完整DOM事件收集与自动化触发;
- 全面分析采集功能包括JS文件、页面原始码、网站截图、网站图标、标题、编码信息以及Cookies等数据。
此外,该工具还支持主机绑定,并允许自定义添加Referer;同时具备请求代理能力及爬虫结果主动替换等功能。
环境要求:
- Docker 18.03以上版本;
- PostgreSQL 9.x及以上版本;
- RabbitMQ 3.8.x或更高版本;
- Docker Compose 1.24+。
架构方面,Crawloop由主节点和多个工作例程组成,并通过gRPC进行通信及使用PostgreSQL数据库存储数据。
全部评论 (0)
还没有任何评论哟~


