2785000
公司业务需要,有比较大的数据爬取需求,有本人负责完成,没找到node里有类似python Scrapy 这种完整的爬虫框架 ,只能自己不断踩坑碰墙,一步步把爬虫也完善了不少。 目前拥有的一些特性: 1.0回调,所有异步操作async化,这个感觉是基础。 2.请求失败的重试、重新登录、账号切换、切换账号Profile等特性 3.多样化数据实时存储,文件方式或数据库方式 4.爬取过程的详细日志,失败任务从断点重新开始等 5.单个爬虫任务以参数启动,配套一个身份账号配置,爬虫任务监控、创建、启动等一系列管理操作的web界面
想搞个类似 Scrapy 的框架,配套各种爬取常用的特性,爬虫的状态监控、日志系统、批量爬取任务管理等等特性,让node开发者在做数据爬取的时候只需要聚焦在爬虫自身的逻辑上,大家觉得有意义吗?可行性有多少?