搜索关键字：mapreduce topk算法，搜索到4057个结果！码迷,mamicode.com！

Hadoop集群维护

HDFS小文件问题及解决方案：http://dongxicheng.org/mapreduce/hdfs-small-files-solution/Hadoop升级方案（一）：Hadoop 1.0内部版本升级（初稿）：http://dongxicheng.org/mapreduce-nextgen/...

分类：其他好文时间：2014-05-10 02:08:24 阅读次数：327

使用hadoop multipleOutputs对输出结果进行不一样的组织

MapReduce job中,可以使用FileInputFormat和FileOutputFormat来对输入路径和输出路径来进行设置。在输出目录中，框架自己会自动对输出文件进行命名和组织，如:part-(m|r)-00000之类。但有时为了后续流程的方便，我们常需要对输出结果进行一定的分类和组织。...

分类：其他好文时间：2014-05-04 10:22:15 阅读次数：341

MapReduce 实现数据join操作

前段时间有一个业务需求，要在外网商品（TOPB2C）信息中加入联营自营识别的字段。但存在的一个问题是，商品信息和自营联营标示数据是两份数据；商品信息较大，是存放在hbase中。他们之前唯一的关联是url。所以考虑用url做key将两者做join，将联营自营标识信息加入的商品信息中，最终生成我需要的数...

分类：其他好文时间：2014-05-04 10:02:22 阅读次数：565

Hadoop初学指南(8)--MapReduce中的Combiner操作

本文主要介绍了MapReduce中的Combiner操作。在MapReduce的执行步骤中，我们一共分了8步，其中Map中的最后一步规约操作就是今天要讲的Combiner。首先看一下前文中的计数器：我们可以发现，其中有两个计数器：Combineoutputrecords和Combineinputrecords，他们的计数都是0，这是..

分类：其他好文时间：2014-05-03 15:00:55 阅读次数：323

Hadoop初学指南(7)--MapReduce自定义计数器

本文主要介绍了MapReduce中的自定义计数器的相关内容。在上次的单词统计例子中，我们可以看到MapReduce在执行过程中会有很多的控制台输出信息，其中有一个很关键的内容：计数器。如下图：可以看到最上方的关键字：Counters，这就表示计数器。在这里，只有一个制表符缩进的表示..

分类：其他好文时间：2014-05-03 14:56:19 阅读次数：336

Hadoop初学指南(5)--MapReduce入门

本文将介绍Hadoop中的重点MapReduce的入门知识。(1)MapReduce概述MapReduce是一种分布式计算模型，由Google提出，主要用于搜索领域，解决海量数据的计算问题。MR由两个阶段组成：Map和Reduce，在Hadoop中用户只需要实现map()和reduce()两个函数，即可实现分布式计算，非常简单..

分类：其他好文时间：2014-05-03 01:53:48 阅读次数：519

Hadoop初学指南(6)--MapReduce的简单实例及分析

本文在上一节的基础上通过一个简单的MR示例对MapReduce的运行流程进行分析。假设有两行数据，分别是helloyou，hellome,我们要统计其中出现的单词以及每个单词出现的次数。所得的结果为hello2you1me1(1)大致运行流畅1.解析成2个<k,v>，分别是<0,helloyou><10,hel..

分类：其他好文时间：2014-05-03 01:51:40 阅读次数：382

Pig安装及本地模式实战

Pig是Apache的一个开源项目，用于简化MapReduce的开发，实质Pig将转化为MapReduce作业，使开发人员更多专注数据而不是执行的本质，是不懂java人员的福利。Pig由以下两部分组成：1、表达数据流的语言，成为PigLatin。2、运行PigLatin程序的执行环境。目前有两种环境：在单个JVM..

分类：其他好文时间：2014-05-02 07:52:55 阅读次数：591

用hadoop实现SimRank++算法(1)----权值转移矩阵的计算

本文主要针对广告检索领域的查询重写应用，根据查询-广告点击二部图，在MapReduce框架上实现SimRank++算法，关于SimRank++算法的背景和原理请参看前一篇文章《基于MapReduce的SimRank++算法研究与实现》。 SimRank++的矩阵形式的计算公式为：算法主要步骤如下： Step1: 计算权值矩阵，并获取最大Query编号和最大广告编号； Step2:...

分类：其他好文时间：2014-05-01 08:21:53 阅读次数：527

MapReduce--Logistic Regression (逻辑回归)

MapReduce--Logistic Regression...

分类：其他好文时间：2014-04-30 22:37:39 阅读次数：830

共4057条上一页 1 ... 403 404 405 406 下一页

分享档案

更多>

2021年07月29日 (22)
2021年07月28日 (40)
2021年07月27日 (32)
2021年07月26日 (79)
2021年07月23日 (29)
2021年07月22日 (30)
2021年07月21日 (42)
2021年07月20日 (16)
2021年07月19日 (90)
2021年07月16日 (35)