6.0 MapReduce 使用

6.0 MapReduce 使用

分类 编程

在学习了之前的 MapReduce 概念之后,我们应该已经知道什么是 Map 和 Reduce,并了解了他们的工作方式。

本章将学习如何使用 MapReduce。

Word Count

Word Count 就是"词语统计",这是 MapReduce 工作程序中最经典的一种。它的主要任务是对一个文本文件中的词语作归纳统计,统计出每个出现过的词语一共出现的次数。

Hadoop 中包含了许多经典的 MapReduce 示例程序,其中就包含 Word Count。

**注意:**这个案例在 HDFS 不运行的状态下依然可以运行,所以我们先在单机模式下测试

首先,启动一个之前制作的 hadoop_proto 镜像的新容器:

复制代码
docker run -d --name=word_count hadoop_proto

进入容器:

复制代码
docker exec -it word_count bash

进入 HOME 目录:

复制代码
cd ~

现在我们准备一份文本文件 input.txt:

复制代码
I love runoob
I like runoob
I love hadoop
I like hadoop

将以上内容用文本编辑器保存。

执行 MapReduce:

复制代码
hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.4.jar wordcount input.txt output

解释一下含义:

hadoop jar从 jar 文件执行 MapReduce 任务,之后跟着的是示例程序包的路径。

wordcount表示执行示例程序包中的 Word Count 程序,之后跟这两个参数,第一个是输入文件,第二个是输出结果的目录名(因为输出结果是多个文件)。

执行之后,应该会输出一个文件夹 output,在这个文件夹里有两个文件:_SUCCESS 和 part-r-00000。

其中 _SUCCESS 只是用于表达执行成功的空文件,part-r-00000 则是处理结果,当我们显示一下它的内容:

复制代码
cat ~/output/part-r-00000

你应该可以看到如下信息:

复制代码
I       4
hadoop  2
like    2
love    2
runoob  2

集群模式

现在我们在集群模式下运行 MapReduce。

启动在上一章配置好的集群容器:

复制代码
docker start nn dn1 dn2

进入 NameNode 容器:

复制代码
docker exec -it nn su hadoop

进入 HOME:

复制代码
cd ~

编辑 input.txt:

复制代码
I love runoob
I like runoob
I love hadoop
I like hadoop

启动 HDFS:

复制代码
start-dfs.sh

创建目录:

复制代码
hadoop fs -mkdir /wordcount
hadoop fs -mkdir /wordcount/input

上传 input.txt

复制代码
hadoop fs -put input.txt /wordcount/input/

执行 Word Count:

复制代码
hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-3.1.4.jar wordcount /wordcount/input /wordcount/output

查看执行结果:

复制代码
hadoop fs -cat /wordcount/output/part-r-00000

如果一切正常,将会显示以下结果:

复制代码
I       4
hadoop  2
like    2
love    2
runoob  2
相关推荐
vxtkjzxt88830 分钟前
手机群控软件在游戏运营中的行为模拟技术实践
大数据
铭毅天下1 小时前
Codebuddy 实现:云端 Elasticsearch 到 本地 Easysearch 跨集群迁移 Python 小工具
大数据·elasticsearch·搜索引擎·全文检索
青云交1 小时前
Java 大视界 -- Java 大数据在智慧交通自动驾驶仿真与测试数据处理中的应用
java·大数据·自动驾驶·数据存储·算法优化·智慧交通·测试数据处理
观远数据2 小时前
A Blueberry 签约观远数据,观远BI以一站式现代化驱动服饰企业新增长
大数据·数据库·人工智能·数据分析
缘华工业智维8 小时前
工业设备预测性维护:能源成本降低的“隐藏钥匙”?
大数据·网络·人工智能
NewsMash8 小时前
马来西亚代表团到访愿景娱乐 共探TikTok直播电商增长新路径
大数据·娱乐
凯禾瑞华养老实训室10 小时前
聚焦生活照护能力培育:老年生活照护实训室建设清单的模块设计与资源整合
大数据·人工智能·科技·ar·vr·智慧养老·智慧健康养老服务与管理
Q264336502312 小时前
【有源码】基于Hadoop生态的大数据共享单车数据分析与可视化平台-基于Python与大数据的共享单车多维度数据分析可视化系统
大数据·hadoop·python·机器学习·数据分析·spark·毕业设计
计算机毕业设计木哥12 小时前
计算机毕设选题推荐:基于Hadoop和Python的游戏销售大数据可视化分析系统
大数据·开发语言·hadoop·python·信息可视化·spark·课程设计