Hadoop组成

Hadoop1.x、Hadoop2.x、Hadoop3.x区别

Hadoop1.x组成:

Hdfs(数据存储)

Common(辅助工具)

MapReduce(计算+资源调度)

Hadoop2.x组成:

HDFS(数据存储)

Common(辅助工具)

Yarn(资源调度)

Mapreduce(计算)

在Hadoop1.x时代,Hadoop中的MapReduce同时处理业务逻辑运算和资源的调度,耦合性较大

在Hadoop2.x时代,增加了Yarn,Yarn只负责资源的调度,Mapreduce只负责运算。

Hadoop3.x在组成上没有变化

HDFS架构概述

Hadoop Distributed FileSystem,简称HDFS,是一个分布式文件系统

Namenode(NN):记录每一个文件块存储的位置

存储文件的元数据,如文件名,文件目录结构,文件属性(生成时间,副本数,文件权限),以及每个文件的块列表和块所在的DataNode等

Datanode(DN):具体存储数据,在本地文件系统存储文件块数据,以及块数据的校验和

2NN(Secondary NameNode):辅助Namenode工作,每隔一段时间对Namenode元数据备份

Yarn架构概述

Yet Another Resource Negotiator简称YARN,另一种资源协调者,是Hadoop的资源管理器

主要管理的就是CPU和内存

ResourceManager(RM):

整个集群资源(内存,CPU等)的老大

NodeManager(NM):单个节点服务器资源老大

Container:容器,相当一台独立的服务器,里面封装了任务运行所需要的资源,如内存,CPU,磁盘,网络等

ApplicationMaster(AM):单个任务运行的老大,任务在Container里面运行,用完就可以释放,更灵活

说明:

客户端可以有多个

集群上可以运行多个ApplicationMaster

每个NodeManager上可以有多个Container

到底可以运行多少个:

一个Container容器默认内存是1-8G

Mapreduce架构概述

Mapreduce将计算过程分为两个阶段:Map和Reduce

Map阶段并行处理输入数据

Reduce阶段对Map结果进行汇总

相关推荐
Devlive 开源社区5 小时前
AuthX 正式更名 GrantForge:我们重新做了一遍权限管理系统
大数据·人工智能·架构
楚楚2515 小时前
2026企业AI办公工具选型指南:落地评估与效果衡量体系
大数据·人工智能
卷毛迷你猪6 小时前
快速实验篇(B16)用户级预测可行性审计(否定性意见)
大数据·hadoop·数据挖掘·聚类
盟接之桥7 小时前
当大模型遇见线束制造:不是通用AI,而是行业AI
大数据·网络·人工智能·安全·制造
归秋1427 小时前
2026 企业 AI 办公工具选型指南:从评估框架到产品适配
大数据·运维·人工智能
枯木◊靠推文躺平版8 小时前
2026 企业级 AI 办公平台选型指南:如何评估可落地的办公 AI 能力
大数据·人工智能
weidian6669 小时前
小红书广告投放形式和小红书广告投放核心流程
大数据
龙亘川10 小时前
数智驱动民政升级 精准守护民生保障
大数据·数据库·人工智能
小蒋观天下11 小时前
端侧大模型在安防摄像头部署实操(上)|行业痛点、架构选型、落地思路解析
大数据·人工智能·安全·计算机视觉·ai大模型
Elastic 中国社区官方博客11 小时前
使用 Lucene 搜索你的 Bean — 索引
java·大数据·数据库·elasticsearch·搜索引擎·全文检索·lucene