
使用Scrapy、Fiddler、Celery和Redis结合MySQL实现分布式定时启动及异步快速动态抓取股票数据的方案.zip
5星
- 浏览量: 0
- 大小:None
- 文件类型:None
简介:
本项目采用Scrapy爬虫框架、Fiddler调试工具、Celery任务队列与Redis缓存,配合MySQL数据库,设计了一套用于分布式环境下定时启动并异步高效获取股票信息的数据采集系统。
Python爬虫的具体功能如下:
1. 连接东方财富网新股页面并爬取所有新股的信息。
2. 剔除股票编码以30开头的创业板块的新股信息。
3. 清洗数据,并将其导入MySQL数据库中。
4. 创建run.py文件,以便自定义定时执行或立即执行获取信息的功能。
5. 使用Celery消息队列工具来自定义程序自动运行和动态间隔运行,实现数据的实时更新功能。
6. 利用Redis作为Celery中的Broker缓存来存储任务队列,并进行异步调度及快速启动爬取操作以达到即时的数据刷新效果。
7. 通过使用Redis做URL缓存构建分布式爬虫系统。
全部评论 (0)
还没有任何评论哟~


