首页 > 资讯 > 精选 >使用Nodejs怎么编写一个定时爬虫

816

分享到

使用Nodejs怎么编写一个定时爬虫

2023-06-09 09:06:06 816人浏览薄情痞子

摘要

使用nodejs怎么编写一个定时爬虫？针对这个问题，这篇文章详细介绍了相对应的分析和解答，希望可以帮助更多想解决这个问题的小伙伴找到更简单易行的方法。const axiOS = require('axi

使用nodejs怎么编写一个定时爬虫？针对这个问题，这篇文章详细介绍了相对应的分析和解答，希望可以帮助更多想解决这个问题的小伙伴找到更简单易行的方法。

const axiOS = require('axios')const roomid = "146088"const ruid = "642922"const url = `https://api.live.bilibili.com/xlive/app-room/v2/guardTab/topList?roomid=${roomid}&ruid=${ruid}&page_size=30`const Captin = { 1: '总督', 2: '提督', 3: '舰长'}const reqPromise = url => axios.get(url);let CaptinList = []let UserList = []async function crawler(URL, pageNow) { const res = await reqPromise(URL); if (pageNow == 1) { CaptinList = CaptinList.concat(res.data.data.top3); } CaptinList = CaptinList.concat(res.data.data.list);}function getMaxPage(res) { const Info = res.data.data.info const { page: maxPage } = Info return maxPage}function getUserList(res) { for (let item of res) { const userInfo = item const { uid, username, guard_level } = userInfo UserList.push({ uid, username, Captin: Captin[guard_level] }) }}async function main(UID) { const maxPage = await reqPromise(`${url}&page=1`).then(getMaxPage) for (let pageNow = 1; pageNow < maxPage + 1; pageNow++) { const URL = `${url}&page=${pageNow}`; await crawler(URL, pageNow); } getUserList(CaptinList) console.log(search(UID, UserList)) return search(UID, UserList)}function search(uid, UserList) { for (let i = 0; i < UserList.length; i++) { if (UserList[i].uid === uid) { return UserList[i]; } } return 0}module.exports = { main}

很明显这个爬虫只能手动触发，直接跑还需要个命令行和node环境，于是就给他用Koa2开了个页面服务，写一个极其简陋的页面

const Koa = require('koa');const app = new Koa();const path = require('path')const fs = require('fs');const router = require('koa-router')();const index = require('./index')const views = require('koa-views')app.use(views(path.join(__dirname, './'), { extension: 'ejs'}))app.use(router.routes());router.get('/', async ctx => { ctx.response.type = 'html'; ctx.response.body = fs.createReadStream('./index.html');})router.get('/api/captin', async (ctx) => { const UID = ctx.request.query.uid console.log(UID) const Info = await index.main(parseInt(UID)) await ctx.render('index', { Info, })});app.listen(3000);

由于页面没有节流防抖，当前版本又只能实时爬取，等待时间较长，频繁刷新自然会触发b站的反爬虫机制，于是当前服务器ip就被风控了。

于是bilibili-live-captain-tools 2.0横空出世

function throttle(fn, delay) { var timer; return function () { var _this = this; var args = arguments; if (timer) {  return; } timer = setTimeout(function () {  fn.apply(_this, args);  timer = null; // 在delay后执行完fn之后清空timer，此时timer为假，throttle触发可以进入计时器 }, delay) }}

再添加节流防抖的同时，使用伪实时爬虫（通过定时任务一分钟爬取一次）

这种情况我们需要去定时执行爬虫脚本了，这个时候我就想到了就可以利用egg的schedule功能了，可是不想让一个爬虫程序如此“大材小用”,遇事不决，百度一下。于是就有了下面的方案

使用 Node Schedule 实现定时任务

Node Schedule是用于node.js的灵活的cron类和非cron类作业调度程序。它允许您使用可选的重复规则来计划作业（任意函数），以在特定日期执行。它在任何给定时间仅使用一个计时器（而不是每秒钟/分钟重新评估即将到来的作业）。

一、安装 node-schedule

npm install node-schedule# 或yarn add node-schedule

二、基本用法

一起啊看一下官方给的例子

const schedule = require('node-schedule');const job = schedule.scheduleJob('42 * * * *', function(){ console.log('The answer to life, the universe, and everything!');});

schedule.scheduleJob 的第一个参数需要如下按照规则输入

Node Schedule规则按下表表示

* * * * * *
┬ ┬ ┬ ┬ ┬ ┬
│ │ │ │ │ |
│ │ │ │ │ └ 星期几，取值：0 - 7，其中 0 和 7 都表示是周日
│ │ │ │ └─── 月份，取值：1 - 12
│ │ │ └────── 日期，取值：1 - 31
│ │ └───────── 时，取值：0 - 23
│ └──────────── 分，取值：0 - 59
└─────────────── 秒，取值：0 - 59（可选）
也可以指定一个具体的时间，如：const date = new Date()

看懂规则我们自己实现一个

const schedule = require('node-schedule');// 定义一个时间let date = new Date(2021, 3, 10, 12, 00, 0);// 定义一个任务let job = schedule.scheduleJob(date, () => { console.log("现在时间:",new Date());});

上面的例子就代表到2021年3月10日12点的时候执行报时

三、高级用法

除了基础的用法，我们还可以使用一些更为灵活的方法来实现定时任务。

1、隔一分钟执行一次

const schedule = require('node-schedule');// 定义规则let rule = new schedule.RecurrenceRule();rule.second = 0//每分钟 0 秒执行一次// 启动任务let job = schedule.scheduleJob(rule, () => { console.log(new Date());});

rule 支持设置的值有 second、minute、hour、date、dayOfWeek、month、year 等。

一些常见的规则如下表

每秒执行
rule.second = [0,1,2,3......59];
每分钟 0 秒执行
rule.second = 0;
每小时 30 分执行
rule.minute = 30;
rule.second = 0;
每天 0 点执行
rule.hour =0;
rule.minute =0;
rule.second =0;
每月 1 号的 10 点执行
rule.date = 1;
rule.hour = 10;
rule.minute = 0;
rule.second = 0;
每周一、周三、周五的 0 点和 12 点执行
rule.dayOfWeek = [1,3,5];
rule.hour = [0,12];
rule.minute = 0;
rule.second = 0;

四、终止任务

可以使用 cancel() 终止一个运行中的任务。当任务出现异常及时取消终止任务

job.cancel();

关于使用Nodejs怎么编写一个定时爬虫问题的解答就分享到这里了，希望以上内容可以对大家有一定的帮助，如果你还有很多疑惑没有解开，可以关注编程网精选频道了解更多相关知识。

--结束END--

本文标题: 使用Nodejs怎么编写一个定时爬虫

本文链接: https://lsjlt.com/news/255514.html(转载时请注明来源链接)

有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

回答

如何调试操作系统的错误？
操作系统

2023-11-15发布

回答

操作系统中的I/O系统是如何实现的？
操作系统

2023-11-15发布

回答

如何实现操作系统的内存管理？
操作系统

2023-11-15发布

回答

什么是虚拟内存，它对操作系统有什么影响？
操作系统

2023-11-15发布

回答

ASP中的MVC架构和WebForms架构有什么区别和使用场景？
ASP.NET

2023-11-15发布

回答

ASP中的数据验证和数据校验有什么不同？
ASP.NET

2023-11-15发布

回答

ASP中的ADO对象和DAO对象有什么区别和使用方法？
ASP.NET

2023-11-15发布

回答

Node.js中的包管理器NPM是什么？如何使用它进行依赖管理？
node.js

2023-11-15发布

回答

Vue.js中的动态组件是什么？如何使用它来动态渲染组件？
VUE

2023-11-15发布

回答

如何使用Vue.js实现懒加载和预加载？
VUE

2023-11-15发布

使用Nodejs怎么编写一个定时爬虫

使用 Node Schedule 实现定时任务

一、安装 node-schedule

二、基本用法

三、高级用法

四、终止任务

使用Nodejs怎么编写一个定时爬虫

使用python编写简单网络爬虫（一）

用Python写一个小爬虫吧！

nodejs中怎么实现一个多页面爬虫

Python使用Beautiful Soup包编写爬虫时的一些关键点

怎么使用nodejs实现一个简单的网页爬虫功能

【Python3爬虫】使用异步协程编写爬

使用C++编写一个DHT爬虫,实现从DHT网络爬取BT种子

使用PHP编写爬虫的方法

Python的爬虫框架scrapy用21行代码写一个爬虫

如何使用PHP编写爬虫程序

怎么用HTML5编写一个时钟

怎么用Python写个听小说的爬虫

怎么使用NodeJs爬虫抓取古代典籍

爬虫时ip怎么合理使用

怎么在python中使用feapde实现一个爬虫

使用Python爬虫怎么实现定时计划任务

利用node.js写一个爬取知乎妹纸图的小爬虫

使用Android爬虫怎么模拟一个登录功能

怎么用Scrapy构建一个网络爬虫

使用golang框架有哪些常见的问题？

golang框架与其他流行框架的比较？

如何使用 C++ STL 扩展 C++ 语言的功能？

PHP 框架安全指南：如何实现安全编码实践？

mysql拆分函数使用要注意哪些事项

C++ 思维导图：全面整理编程核心知识

基于社区支持最强大的PHP框架

如何在 C++ 中有效使用 STL 函数对象？

PHP 框架中的调试和故障排除技术

经验丰富的开发者的PHP框架评估指南