码迷,mamicode.com
首页 > Web开发 > 详细

nodeJS实现简易爬虫

时间:2019-08-28 17:10:14      阅读:122      评论:0      收藏:0      [点我收藏+]

标签:获取   实现   creat   name   new   end   jpg   系统   src   

nodeJS实现简易爬虫

需求:使用nodeJS爬取昵图网某个分类下的图片并存入本地

  • 运用nodeJS自带系统模块http、fs

    示例代码:

var http =require('http');
var fs =require('fs');

var curentPage=1; //当前图片页数
var maxcurentPage=5;//最大页数
//获取图片地址
function getData(){
    let url = 'http://www.nipic.com/photo/xiandai/jiaotong/index.html?page='+curentPage
    http.get(url,(res)=>{
        var data = '';
        res.on('data',(a)=>{
            data+=a.toString();
        })
        res.on('end',()=>{
            let reg = /<img src="(.+?)" data-src="(.*?)"  alt="(.*?)" \/>/g
            let arr=[];
            while (reg.exec(data)){
                arr.push(reg.exec(data)[2]);
            }
            for(i in arr){
                (function(i){
                    setTimeout(()=>{
                        getImg(arr[i])
                    },500*i)
                })(i)
            }
            if (curentPage < maxcurentPage){
                curentPage++;
                arguments.callee();
            }
        })
    })
}
//图片写入img文件夹
function getImg(url){
    let u = url.replace(/\/pic\//,'/file/')
        .replace(/_4.jpg/,'_2.jpg');
    http.get(u,(res)=>{
        let name = new Date().getTime();
        let stream = fs.createWriteStream('./img/' + name + '.png');
        res.pipe(stream);
    })
}
getData();

nodeJS实现简易爬虫

标签:获取   实现   creat   name   new   end   jpg   系统   src   

原文地址:https://www.cnblogs.com/sgs123/p/11425008.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!