码迷,mamicode.com
首页 > 编程语言 > 详细

Python3 使用 urllib 编写爬虫

时间:2018-01-05 01:22:11      阅读:633      评论:0      收藏:0      [点我收藏+]

标签:wow   请求头   图片   infopath   对象   inux   name   ota   通过   

什么是爬虫

    爬虫,也叫蜘蛛(Spider),如果把互联网比喻成一个蜘蛛网,Spider就是一只在网上爬来爬去的蜘蛛。网络爬虫就是根据网页的地址来寻找网页的,也就是URL。举一个简单的例子,我们在浏览器的地址栏中输入的字符串就是URL,例如:https://www.baidu.com

    URL就是同意资源定位符(Uniform Resource Locator),它的一般格式如下(带方括号[]的为可选项):

    protocol :// hostname[:port] / path / [;parameters][?query]#fragment

    URL的格式主要由三部分组成:

    1. protocol:第一部分就是协议,例如百度使用的就是https协议;  
    2. hostname[:port]:第二部分就是主机名(还有端口号为可选参数),一般网站默认的端口号为80,例如百度的主机名就是www.baidu.com,这个就是服务器的地址;  
    3. path:第三部分就是主机资源的具体地址,如目录和文件名等。  

    爬虫就是根据URL来获取网页信息的。

Python3的urllib包

  urllib包提供的模块可以用来使Python代码访问url。

  从Python3官方的urllib包介绍可以知道,在Python3中的内置库中把Python2 的urllib、urllib2两个库整合成了urllib包。

  在urllib包中只提供了4个模块:

    1. urllib.request:用来打开或者读取Urls
    2. urllib.error:包含urllib.request的异常信息
    3. urllib.parse:包含Urls需要的参数信息
    4. urllib.robotparser:配置robots.txt文件的相关功能

相对于Python 2中的变化

  • 在Pytho2.x中使用import urllib2  --->  在Python3.x中会使用import urllib.requesturllib.error
  • 在Pytho2.x中使用import urllib  --->  在Python3.x中会使用import urllib.requesturllib.error
  • 在Pytho2.x中使用import urlparse  --->  在Python3.x中会使用import urllib.parse
  • 在Pytho2.x中使用import urlopen  --->  在Python3.x中会使用import urllib.request.urlopen
  • 在Pytho2.x中使用import urlencode  --->  在Python3.x中会使用import urllib.parse.urlencode
  • 在Pytho2.x中使用import urllib.quote  --->  对应的,在Python3.x中会使用import urllib.request.quote
  • 在Pytho2.x中使用cookielib.CookieJar  --->  对应的,在Python3.x中会使用http.CookieJar
  • 在Pytho2.x中使用urllib2.Request  --->  在Python3.x中会使用urllib.request.Request

基本使用

urllib.request.urlopen():访问一个URL,返回一个包含网页信息的对象

response.read():获取返回对象的内容

response.getcode():获取返回的HTTP Code

response.info():获取返回的元数据信息,例如HTTP Header

response.geturl():获取访问的url

# 使用Python访问博客园,获取网页信息

import urllib.request

response = urllib.request.urlopen(‘http://www.cnblogs.com/dachenzi‘)
data = response.read().decode(‘utf-8‘)

print(data)

 利用Python下载一个图片

import urllib.request

url = ‘http://img.lenovomm.com/s3/img/app/app-img-lestore/2370-2015-07-16035439-1437033279327.jpg?isCompress=true&width=320&height=480&quantity=1&rotate=true‘

response = urllib.request.urlopen(url)
data = response.read()

with open(‘img.jpg‘,‘wb‘) as f:  # 图片输入二进制文件,所以只需要使用b模式打开写入即可
    f.write(data)

注意:这里urlopen可以接受一个str,或者一个request对象

小练习

使用Python完成翻译小程序,输入中文返回英文信息,反正亦然。

# 1、使用浏览器访问,查看Network,确定提交数据访问的地址以及提交的data

 

定制HTTP header

  HTTP Header,表示在浏览器在进行访问(HTTP请求)时携带的头部信息,什么叫定制HTTP请求头呢,举个栗子:其实每天活跃在网上的爬虫太多了,如果网站不进行限制的话,那么访问流量会很高,所以站点基本都会对爬虫进行基本的限制,而利用User-Agent (浏览器标示)是最常用的方式,使用浏览器和使用Python代码来访问站点时,浏览器标示时不同的。

  本人的google浏览器是:Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.84 Safari/537.36

  python代码是:Python 3.6.3 ..

  这里既然说定制,那么就是说可以对User-Agent等头部参数进行修改。

修改User-Agent

  修改请求的User-Agent就需要先定制request对象了,然后把对象传给urlopen进行访问

import urllib.request

url = ‘http://img.lenovomm.com/s3/img/app/app-img-lestore/2370-2015-07-16035439-1437033279327.jpg?isCompress=true&width=320&height=480&quantity=1&rotate=true‘

head = {}
head[‘User-Agent‘] = ‘Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.84 Safari/537.36‘

request = urllib.request.Request(url,headers=head)  # 创建Request对象,并设置headers
response = urllib.request.urlopen(request)

data = response.read()

with open(‘img.jpg‘,‘wb‘) as f:
    f.write(data)
技术分享图片
 1  "Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; AcooBrowser; .NET CLR 1.1.4322; .NET CLR 2.0.50727)",
 2     "Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 6.0; Acoo Browser; SLCC1; .NET CLR 2.0.50727; Media Center PC 5.0; .NET CLR 3.0.04506)",
 3     "Mozilla/4.0 (compatible; MSIE 7.0; AOL 9.5; AOLBuild 4337.35; Windows NT 5.1; .NET CLR 1.1.4322; .NET CLR 2.0.50727)",
 4     "Mozilla/5.0 (Windows; U; MSIE 9.0; Windows NT 9.0; en-US)",
 5     "Mozilla/5.0 (compatible; MSIE 9.0; Windows NT 6.1; Win64; x64; Trident/5.0; .NET CLR 3.5.30729; .NET CLR 3.0.30729; .NET CLR 2.0.50727; Media Center PC 6.0)",
 6     "Mozilla/5.0 (compatible; MSIE 8.0; Windows NT 6.0; Trident/4.0; WOW64; Trident/4.0; SLCC2; .NET CLR 2.0.50727; .NET CLR 3.5.30729; .NET CLR 3.0.30729; .NET CLR 1.0.3705; .NET CLR 1.1.4322)",
 7     "Mozilla/4.0 (compatible; MSIE 7.0b; Windows NT 5.2; .NET CLR 1.1.4322; .NET CLR 2.0.50727; InfoPath.2; .NET CLR 3.0.04506.30)",
 8     "Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN) AppleWebKit/523.15 (KHTML, like Gecko, Safari/419.3) Arora/0.3 (Change: 287 c9dfb30)",
 9     "Mozilla/5.0 (X11; U; Linux; en-US) AppleWebKit/527+ (KHTML, like Gecko, Safari/419.3) Arora/0.6",
10     "Mozilla/5.0 (Windows; U; Windows NT 5.1; en-US; rv:1.8.1.2pre) Gecko/20070215 K-Ninja/2.1.1",
11     "Mozilla/5.0 (Windows; U; Windows NT 5.1; zh-CN; rv:1.9) Gecko/20080705 Firefox/3.0 Kapiko/3.0",
12     "Mozilla/5.0 (X11; Linux i686; U;) Gecko/20070322 Kazehakase/0.4.5",
13     "Mozilla/5.0 (X11; U; Linux i686; en-US; rv:1.9.0.8) Gecko Fedora/1.9.0.8-1.fc10 Kazehakase/0.5.6",
14     "Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.56 Safari/535.11",
15     "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_3) AppleWebKit/535.20 (KHTML, like Gecko) Chrome/19.0.1036.7 Safari/535.20",
16     "Opera/9.80 (Macintosh; Intel Mac OS X 10.6.8; U; fr) Presto/2.9.168 Version/11.52",
更多的User-Agent

添加heades的另一种方法

除了在代码中通过字典定义header以外,还可以使用request对象的add_header()方法,进行添加

import urllib.request

url = ‘http://img.lenovomm.com/s3/img/app/app-img-lestore/2370-2015-07-16035439-1437033279327.jpg?isCompress=true&width=320&height=480&quantity=1&rotate=true‘


# head = {}
# head[‘User-Agent‘] = ‘Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.84 Safari/537.36‘

request = urllib.request.Request(url)  # 创建Request对象,并设置headers
request.add_header(‘User-Agent‘,‘Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/63.0.3239.84 Safari/537.36‘)
response = urllib.request.urlopen(request)

data = response.read()

with open(‘img.jpg‘,‘wb‘) as f:
    f.write(data)

 

Python3 使用 urllib 编写爬虫

标签:wow   请求头   图片   infopath   对象   inux   name   ota   通过   

原文地址:https://www.cnblogs.com/dachenzi/p/8196472.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!