码迷,mamicode.com
首页 > 编程语言 > 详细

【Python】从0开始写爬虫——豆瓣电影

时间:2018-08-18 15:32:03      阅读:175      评论:0      收藏:0      [点我收藏+]

标签:Once   EDA   window   名称   head   rap   工具   limit   star   

1. 最近略忙。。java在搞soap,之前是用工具自动生成代码的。最近可能会写一个soap的java调用

2. 这个豆瓣电影的爬虫。扒信息的部分暂时先做到这了。扒到的信息如下

from scrapy import app
import re

header = {
    User-Agent:
        Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36,
    Host: movie.douban.com,
    Accept-Language: zh-CN,zh;q=0.9
}

movie_url = "https://movie.douban.com/subject/27132728/?tag=%E7%83%AD%E9%97%A8&from=gaia"

m_id = re.search("[0-9]+", movie_url).group()

# 获取soup对象
soup = app.get_soup(url=movie_url, headers=header, charset="utf-8")
content = soup.find(id="content")

# 抓取电影名字和上映年份
m_name = content.find("h1").find("span").string
m_year = content.find(class_="year").string
m_year = m_year[1:-1]  # 去掉头尾的括号

# 抓取导演
info = content.find(id="info")
m_directer = info.find(attrs={"rel": "v:directedBy"}).string# 上映日期
m_date = info.find(attrs={"property": "v:initialReleaseDate"}).string
m_date = re.search("[-,0-9]+", m_date).group()

# 类型
types = info.find_all(attrs={"property": "v:genre"}, limit=2)
m_types = []
for type_ in types:
    m_types.append(type_.string)


# 抓取主演,只取前面五个
actors = info.find(class_="actor").find_all(attrs={"rel": "v:starring"}, limit=5)
m_actors = []
for actor in actors:
    m_actors.append(actor.string)

# 片长
m_time = info.find(attrs={"property": "v:runtime"}).string
m_time = re.search("[0-9]+", m_time).group()


# 评分
score_info = soup.find(id="interest_sectl")
m_score = score_info.find("strong").string


m_stars = score_info.find_all(class_="rating_per")
m_rate = []
for star in m_stars:
    m_rate.append(star.string[:-1])

m_votes = score_info.find(attrs={"property": "v:votes"}).string

print("id", m_id, "名称", m_name, "年份 ", m_year, "导演 ", m_directer, "主演", m_actors)

print("上映日期", m_date, "类型", m_types, "片长", m_time)

print("评分", m_score, "星评(从5星到1星)", m_rate, "评价总数", m_votes)

输出如下

id 27132728 名称 致命警告 El aviso 年份  2018 导演  丹尼尔·卡尔帕索罗 主演 [奥拉·加里多, 劳尔·阿雷瓦洛, 贝伦·奎斯塔, Sergio Mur, Aitor Luna]
上映日期 2018-03-23 类型 [惊悚] 片长 92
评分 6.4 星评(从5星到1星) [14.2, 19.9, 41.1, 21.3, 3.5] 评价总数 445

 

把这些狗东西封装成一个方法。并且随便找几个豆瓣电影的url试一下。在多尝试几个url之后,会报一些问题,主要是没有进行空判断, 所以稍微修改了一点

from scrapy import app
import re


def douban_movie(movie_url):

    header = {
        User-Agent:
            Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/50.0.2661.102 Safari/537.36,
        Host: movie.douban.com,
        Accept-Language: zh-CN,zh;q=0.9
    }
    m_id = re.search("[0-9]+", movie_url).group()

    # 获取soup对象
    soup = app.get_soup(url=movie_url, headers=header, charset="utf-8")
    content = soup.find(id="content")

    # 抓取电影名字和上映年份
    m_name = content.find("h1").find("span").string
    m_year = content.find(class_="year").string
    m_year = m_year[1:-1]  # 去掉头尾的括号

    # 抓取导演
    info = content.find(id="info")
    m_directer = info.find(attrs={"rel": "v:directedBy"}).string

    # 上映日期
    m_date = info.find(attrs={"property": "v:initialReleaseDate"}).string
    m_date = re.search("[-,0-9]+", m_date).group()

    # 类型
    types = info.find_all(attrs={"property": "v:genre"}, limit=2)
    m_types = []
    for type_ in types:
        m_types.append(type_.string)

    # 抓取主演,只取前面五个
    actors = info.find(class_="actor").find_all(attrs={"rel": "v:starring"}, limit=5)
    m_actors = []
    for actor in actors:
        m_actors.append(actor.string)

    # 片长
    m_time = info.find(attrs={"property": "v:runtime"})
    m_time = re.search("[0-9]+", m_time.string).group() if m_time else 0

    # 评分
    score_info = soup.find(id="interest_sectl")
    m_score = score_info.find("strong").string

    m_stars = score_info.find_all(class_="rating_per")
    m_rate = []
    for star in m_stars:
        m_rate.append(star.string[:-1])

    m_votes = score_info.find(attrs={"property": "v:votes"})
    m_votes = m_votes.string if m_votes else 0

    print("id", m_id, "名称", m_name, "年份 ", m_year, "导演 ", m_directer, "主演", m_actors)

    print("上映日期", m_date, "类型", m_types, "片长", m_time)

    print("评分", m_score, "星评(从5星到1星)", m_rate, "评价总数", m_votes)


douban_movie("https://movie.douban.com/subject/30236775/?from=showing")
douban_movie("https://movie.douban.com/subject/26842702/?tag=%E7%83%AD%E9%97%A8&from=gaia")
douban_movie("https://movie.douban.com/subject/26973784/?tag=%E6%9C%80%E6%96%B0&from=gaia")
douban_movie("https://movie.douban.com/subject/30249296/?tag=%E7%83%AD%E9%97%A8&from=gaia")

输出如下

id 30236775 名称 旅行吧!井底之蛙 年份  2018 导演  陈设 主演 [王雪沁, 吴凡, 周宗禹, 强光宗, 张艺文]
上映日期 2018-08-18 类型 [动画, 奇幻] 片长 78
评分 None 星评(从5星到1星) [] 评价总数 0
id 26842702 名称 燃烧 ?? 年份  2018 导演  李沧东 主演 [刘亚仁, 史蒂文·元, 全钟瑞, 金秀京, 崔承浩]
上映日期 2018-05-16 类型 [剧情, 悬疑] 片长 148
评分 7.9 星评(从5星到1星) [25.9, 48.1, 21.4, 3.2, 1.3] 评价总数 81519
id 26973784 名称 设局 La niebla y la doncella 年份  2017 导演  安德烈斯·M·科佩尔 主演 [基姆·古铁雷斯, 薇洛妮卡·恩切圭, 奥拉·加里多, 罗伯托·阿拉莫]
上映日期 2017-09-08 类型 [惊悚] 片长 0
评分 5.2 星评(从5星到1星) [1.2, 9.8, 42.0, 40.0, 7.1] 评价总数 320
id 30249296 名称 我们的侣行 第二季 年份  2018 导演  张昕宇 主演 [张昕宇, 梁红]
上映日期 2018-06-12 类型 [真人秀] 片长 0
评分 8.9 星评(从5星到1星) [59.3, 27.8, 11.1, 1.9, 0.0] 评价总数 342

 

【Python】从0开始写爬虫——豆瓣电影

标签:Once   EDA   window   名称   head   rap   工具   limit   star   

原文地址:https://www.cnblogs.com/yeyeck/p/9497324.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!