搜索关键字：SPARK RDD，搜索到7287个结果！码迷,mamicode.com！

Apache Spark源码走读之10 -- 在YARN上运行SparkPi

y欢迎转载，转载请注明出处，徽沪一郎。概要“spark已经比较头痛了，还要将其运行在yarn上，yarn是什么，我一点概念都没有哎，再怎么办啊。不要跟我讲什么原理了，能不能直接告诉我怎么将spark在yarn上面跑起来，I'm a dummy, just told me how to do it.”...

分类：其他好文时间：2014-07-07 14:23:52 阅读次数：278

Apache Spark源码走读之3 -- Task运行期之函数调用关系分析

欢迎转载，转载请注明出处，徽沪一郎。概要本篇主要阐述在TaskRunner中执行的task其业务逻辑是如何被调用到的，另外试图讲清楚运行着的task其输入的数据从哪获取，处理的结果返回到哪里，如何返回。准备spark已经安装完毕spark运行在local mode或local-cluster mod...

分类：其他好文时间：2014-07-07 14:20:42 阅读次数：267

Apache Spark源码走读之15 -- Standalone部署模式下的容错性分析

欢迎转载，转载请注明出处，徽沪一郎。概要本文就standalone部署方式下的容错性问题做比较细致的分析，主要回答standalone部署方式下的包含哪些主要节点，当某一类节点出现问题时，系统是如何处理的。Standalone部署的节点组成介绍Spark的资料中对于RDD这个概念涉及的比较多，但对于...

分类：其他好文时间：2014-07-07 14:19:57 阅读次数：274

Apache Spark源码走读之8 -- Spark on Yarn

欢迎转载，转载请注明出处，徽沪一郎。概要Hadoop2中的Yarn是一个分布式计算资源的管理平台，由于其有极好的模型抽象，非常有可能成为分布式计算资源管理的事实标准。其主要职责将是分布式计算集群的管理，集群中计算资源的管理与分配。Yarn为应用程序开发提供了比较好的实现标准，Spark支持Yarn部...

分类：其他好文时间：2014-07-07 14:18:32 阅读次数：297

Apache Spark源码走读之12 -- Hive on Spark运行环境搭建

欢迎转载，转载请注明出处，徽沪一郎。楔子Hive是基于Hadoop的开源数据仓库工具，提供了类似于SQL的HiveQL语言，使得上层的数据分析人员不用知道太多MapReduce的知识就能对存储于Hdfs中的海量数据进行分析。由于这一特性而收到广泛的欢迎。Hive的整体框架中有一个重要的模块是执行模块...

分类：其他好文时间：2014-07-07 14:17:47 阅读次数：295

Apache Spark源码走读之2 -- Job的提交与运行

欢迎转载，转载请注明出处，徽沪一郎。概要本文以wordCount为例，详细说明spark创建和运行job的过程，重点是在进程及线程的创建。实验环境搭建在进行后续操作前，确保下列条件已满足。下载spark binary 0.9.1安装scala安装sbt安装java启动spark-shell单机模式运...

分类：其他好文时间：2014-07-07 14:14:34 阅读次数：231

Apache Spark源码走读之14 -- Graphx实现剖析

欢迎转载，转载请注明出处，徽沪一郎。概要图的并行化处理一直是一个非常热门的话题，这里头的重点有两个，一是如何将图的算法并行化，二是找到一个合适的并行化处理框架。Spark作为一个非常优秀的并行处理框架，将一些并行化的算法移到其上面就成了一个很自然的事情。Graphx是一些图的常用算法在Spark上的...

分类：其他好文时间：2014-07-07 14:11:44 阅读次数：391

Apache Spark源码走读之9 -- Spark源码编译

欢迎转载，转载请注明出处，徽沪一郎。概要本来源码编译没有什么可说的，对于java项目来说，只要会点maven或ant的简单命令，依葫芦画瓢，一下子就ok了。但到了Spark上面，事情似乎不这么简单，按照spark officical document上的来做，总会出现这样或那样的编译错误，让人懊恼不...

分类：其他好文时间：2014-07-07 14:07:04 阅读次数：268

Apache Spark源码走读之1 -- Spark论文阅读笔记

欢迎转载，转载请注明出处，徽沪一郎。楔子源码阅读是一件非常容易的事，也是一件非常难的事。容易的是代码就在那里，一打开就可以看到。难的是要通过代码明白作者当初为什么要这样设计，设计之初要解决的主要问题是什么。在对Spark的源码进行具体的走读之前，如果想要快速对Spark的有一个整体性的认识，阅读Ma...

分类：其他好文时间：2014-07-07 14:05:42 阅读次数：285

Apache Spark源码走读之7 -- Standalone部署方式分析

欢迎转载，转载请注明出处，徽沪一郎。楔子在Spark源码走读系列之2中曾经提到Spark能以Standalone的方式来运行cluster，但没有对Application的提交与具体运行流程做详细的分析，本文就这些问题做一个比较详细的分析，并且对在standalone模式下如何实现HA进行讲解。没有...

分类：其他好文时间：2014-07-07 14:05:03 阅读次数：352

共7287条上一页 1 ... 718 719 720 721 722 ... 729 下一页

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)