码迷,mamicode.com
首页 > 其他好文 > 详细

Hadoop快速入门

时间:2018-11-04 19:42:26      阅读:145      评论:0      收藏:0      [点我收藏+]

标签:运算   out   ado   数据采集   技术   开源软件   功能   就是   程序开发   

1、什么是Hadoop
  1). HADOOP是apache旗下的一套开源软件平台
  2). HADOOP提供的功能:利用服务器集群,根据用户的自定义业务逻辑,对海量数据进行分布式处理
  3). HADOOP的核心组件有
    A). HDFS(分布式文件系统)
    B). YARN(运算资源调度系统)
    C). MAPREDUCE(分布式运算编程框架)
    4). 广义上来说,HADOOP通常是指一个更广泛的概念——HADOOP生态圈

  5).云计算是分布式计算、并行计算、网格计算、多核计算、网络存储、虚拟化、负载均衡等传统计算机技术和互联网技术融合发展的产物
  6).国内外Hadoop应用案例介绍
    1、HADOOP应用于数据服务基础平台建设
    2、HADOOP用于用户画像
    3、HADOOP用于网站点击流日志数据挖掘

  7).重点组件
    HDFS:分布式文件系统
    MAPREDUCE:分布式运算程序开发框架
    HIVE:基于大数据技术(文件系统+运算框架)的SQL数据仓库工具,使用方便,功能丰富,基于MR延迟大
    HBASE:基于HADOOP的分布式海量数据库,离线分析和在线业务通吃
    ZOOKEEPER:分布式协调服务基础组件
    Mahout:基于mapreduce/spark/flink等分布式运算框架的机器学习算法库
    Oozie:工作流调度框架
    Sqoop:数据导入导出工具
    Flume:日志数据采集框架
    (HADOOP(hdfs、MAPREDUCE、yarn) 元老级大数据处理技术框架,擅长离线数据分析)

  8).分布式软件系统(distributed software system)
    该软件系统会划分成多个子系统或模块,各自运行在不同的机器上,子系统或模块之间通过网络通信进行协作,实现最终的整体功能
  
    总结:利用多个节点共同协作完成一项或多项具体业务功能的系统就是分布式系统。

  9).数据处理流程
    采集数据——》数据预处理——》导入HIVE仓库——》ETL——》报表统计——》结果导出到MYSQL——》数据可视化
    1) 数据采集:定制开发采集程序,或使用开源框架FLUME
    2) 数据预处理:定制开发mapreduce程序运行于hadoop集群
    3) 数据仓库技术:基于hadoop之上的Hive
    4) 数据导出:基于hadoop的sqoop数据导入导出工具
    5) 数据可视化:定制开发web程序或使用kettle等产品
    6) 整个过程的流程调度:hadoop生态圈中的,azkaban,oozie工具或其他类似开源产品


2、集群简介
  HADOOP集群具体来说包含两个集群:HDFS集群和YARN集群,两者逻辑上分离,但物理上常在一起
  HDFS集群:
    负责海量数据的存储,集群中的角色主要有 NameNode / DataNode
  YARN集群:
    负责海量数据运算时的资源调度,集群中的角色主要有 ResourceManager /NodeManager

 

Hadoop快速入门

标签:运算   out   ado   数据采集   技术   开源软件   功能   就是   程序开发   

原文地址:https://www.cnblogs.com/atomicbomb/p/9904504.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!