Hadoop3教程(九):MapReduce框架原理概述

文章目录

简介

这属于整个MR中最核心的一块,后续小节会展开描述。

整个MR处理流程,是分为Map阶段和Reduce阶段。

一般,我们称Map阶段的进程是MapTask,称Reduce阶段是ReduceTask。

其完整的工作流程如图:

Map阶段具体的工作任务是啥呢?

1) map阶段决定,根据数据源,可以选择根据什么方式来读取数据;

默认情况下,map阶段读数据,是按行读,读取到的KV里,K是偏移量(可以理解成行数),V是这一行的内容。那map阶段是不是只能这么行读呢?

不是。

这里就要介绍一个组件,叫做InputFormat,它就是用来控制数据的读取形式。

Hadoop中的InputFormat有好几种实现,如FileInputFormat、TextInputFormat和CombineTextInputFormat等。

2) 数据在被读进来之后,就会交给Mapper来进行自定义业务逻辑的处理;

3)接着进行shuffle ,这是一个非常复杂的过程,可以在这里进行排序、分区、压缩、合并等等, 堪称MapReduce中最核心的环节。

最后进入reduce阶段 ,也有一个组件,叫做OutputFormat,用来控制数据的输出形式。同样的,它也有好几种实现,默认的OutputFormat是把数据写进文件里,那我想写进数据库里,可不可以呢?

当然可以,自定义OutputFormat就可以。

接下来的几节就会围绕这个流程做展开讲述:

  • InputFormat
  • Shuffle机制
  • OutputFormat
  • Join应用

参考文献

  1. 【尚硅谷大数据Hadoop教程,hadoop3.x搭建到集群调优,百万播放】
相关推荐
starzy199023 分钟前
SparkStreaming 之容错机制深度剖析
大数据·spark
记忆张量MemTensor40 分钟前
MemOS Skill 上线|一句话即可接入 MemOS Cloud
大数据·数据库·人工智能·typescript·开源
TKcloudmaster_H1 小时前
拆解TK跨境矩阵逻辑:不同区域该怎么规避违规风险
大数据·矩阵·新媒体运营·产品运营·流量运营
zhixingheyi_tian1 小时前
TPCDS 之 Q72
大数据
LoveAmySun1 小时前
AI智能体如何落地公交营运真实业务
大数据·人工智能
adinnet20261 小时前
辅助写作与文档整理,从会议纪要到标书,让智能体当好“笔杆子“
大数据·人工智能
whcyhhh2 小时前
头歌实践教学平台:数据科学与大数据技术导论(九上)
大数据·python
新新学长搞科研2 小时前
【经济、管理、大数据可接收】第二届人工智能、业务转型和数据科学创新国际学术会议(ICBTDS 2026)
大数据·人工智能
墨_浅-2 小时前
20260825金融科技动向:智能体支付应用自律公约
大数据·科技·金融
Databend2 小时前
Cluster Key 最佳实践:列怎么选、顺序怎么排与粒度设计
大数据·数据库·sql