码迷,mamicode.com
首页 > 编程语言 > 详细

python+正则+多进程爬取糗事百科图片

时间:2019-08-06 13:48:01      阅读:97      评论:0      收藏:0      [点我收藏+]

标签:not   webkit   ESS   路由   roc   com   from   多进程   try   

话不多说,直接上代码;

# 需要的库
import requests
import re
import os
from multiprocessing import Pool
# 请求头
headers = {
    User-Agent: Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/65.0.3325.181 Safari/537.36
}

# 主函数
def get_img(url):
    # 定义图片存储路径
    img_path = ./img/
    if not os.path.exists(img_path):
        os.mkdir(img_path)
    try:
        # 请求网页
        response = requests.get(url=url,headers=headers)
        # 正则提取图片地址
        response = re.findall(<div class="thumb".*?<img src="(.*?)".*?</a>,response.text,re.S)
        # 循环图片地址
        for i in response:
            # 拼接完整图片路由
            url = (http: + i)
            # 请求完整图片路由
            response = requests.get(url,headers)
            # 图片命名
            img_name = url.split(/)[-1]
            # 判断图片是否已下载
            if os.path.exists(img_path+img_name):
                print(图片已存在)
            else:
                # 下载图片
                with open(img_path+img_name,wb) as f:
                    f.write(response.content)
                    print(正在下载:+url)
    except Exception as e:
        print(e)
# 程序主入口
if __name__ == __main__:
    # 构造所有ip地址
    urls = [https://www.qiushibaike.com/imgrank/page/{}/.format(i) for i in range(1,14)]
    # 使用多进程
    pool = Pool()
    # 开启多进程爬取
    pool.map(get_img,urls)
    print(下载完毕)

下载中;

技术图片

打开文件夹查看图片;

技术图片

 

done

 

python+正则+多进程爬取糗事百科图片

标签:not   webkit   ESS   路由   roc   com   from   多进程   try   

原文地址:https://www.cnblogs.com/nmsghgnv/p/11308354.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!