Hadoop-HDFS

Hadoop的HDFS(Hadoop Distributed File System)是一个分布式文件系统,它被设计用来在普通的硬件上运行,并且提供高吞吐量访问应用程序数据的能力。

HDFS 架构

HDFS 遵循主/从架构,由单个 NameNode(NN) 和多个 DataNode(DN) 组成:

  • NameNode : 负责执行有关 文件系统命名空间 的操作,例如打开,关闭、重命名文件和目录等。它同时还负责集群元数据的存储,记录着文件中各个数据块的位置信息。(第一无二,主要职责就是沟通协调)
  • DataNode:负责提供来自文件系统客户端的读写请求,执行块的创建,删除等操作。(依稀系统可以有多个,主要职责就是存储数据)

各角色职责

写数据

客户端

  1. 写数据时负责将文件切分成数据块 (64,128MB)
  2. 2个重要参数:block size:标识块大小;replication faxtor:表示数据存储在几个不通的地方

NameNode:

  1. NameNode分配DataNode地址给客户端

DataNode:

  1. 将数据存储在硬盘里
  2. 接收数据时同时将同样的数据发送下一个DataNode
  3. 通知NameNode数据所有数据写入完成

读数据

客户端

  1. 告诉NameNode所要读取的文件名
  2. 根据NameNode返回的数据块地址,从最近的一个DataNode请求返回数据

NameNode:

  1. 收到客户端读请求后返回数据所在的地址,包括数据块列表和数据块对应的DataNode列表

DataNode:

  1. 收到客户端请求后返回数据

故障检测

  1. DataNode会每3秒发送一个心跳到NameNode,如果NameNode在10分钟内没有收到DataNode发送的心跳,则认为DataNode已经挂了。
  2. 客户端在发送数据到DataNode时,DataNode会回复一个应答信号,如果客户端没有收到应答信号(多次尝试后),客户端会认为主机已经挂掉。
  3. 客户端在发送数据到DataNode时,会携带一段校验和,DataNode会将数据和校验和一起存到硬盘。
  4. DataNode会定时发送所有DataNode的数据报告给NameNode,发送前会校验校验和,若数据损坏(校验和不正确),则不会发送损坏的数据块信息。

故障处理

客户端

  1. 写数据: 以一个数据包为一个单位写入DataNode,DataNode在接受到数据包后会回复应答信号,如果客户端没收到DataNode的应答信号,则认为该DataNode挂了,会跳过该节点。该挂掉的节点随后会被NameDate处理。
  2. **读数据:**如果读某个节点发现无响应数据,则跳过读在一个。

NameNode

  1. 这玩意存储有2张表,一个是数据块列表-保存了每个数据块在哪些DataNode上(数据块1:存储在 DataNode1,DataNode2,DataNode3),一个是DataNode列表-保存了每个DataNode上存储着哪些数据块(DataNode1:存储着数据块1,数据块2)。
  2. 如果书数据块损坏,则会更新数据块列表,将该数据块从表中删除
  3. 如果是DataNode损坏,会同时更新2张表
  4. 定时扫描数据块列表,检查每个数据块是否被充分备份,如果在扫描过程中发现数据块损坏或丢失,DataNode会向NameNode报告这些错误。NameNode随后会从其他DataNode复制相应的数据块副本,以修复损坏的数据。
相关推荐
B站计算机毕业设计超人5 天前
计算机毕业设计Django+Vue.js高考推荐系统 高考可视化 大数据毕业设计(源码+LW文档+PPT+详细讲解)
大数据·vue.js·hadoop·django·毕业设计·课程设计·推荐算法
B站计算机毕业设计超人5 天前
计算机毕业设计Django+Vue.js音乐推荐系统 音乐可视化 大数据毕业设计 (源码+文档+PPT+讲解)
大数据·vue.js·hadoop·python·spark·django·课程设计
十月南城5 天前
数据湖技术对比——Iceberg、Hudi、Delta的表格格式与维护策略
大数据·数据库·数据仓库·hive·hadoop·spark
王九思5 天前
Hive Thrift Server 介绍
数据仓库·hive·hadoop
Asher05095 天前
Hive核心知识:从基础到实战全解析
数据仓库·hive·hadoop
yumgpkpm5 天前
AI视频生成:Wan 2.2(阿里通义万相)在华为昇腾下的部署?
人工智能·hadoop·elasticsearch·zookeeper·flink·kafka·cloudera
Asher05096 天前
Hadoop核心技术与实战指南
大数据·hadoop·分布式
江畔何人初7 天前
hadoop中HDFS框架、YARN框架各组件职责与对比
大数据·hadoop·hdfs
Francek Chen8 天前
【大数据存储与管理】分布式文件系统HDFS:05 HDFS存储原理
大数据·hadoop·分布式·hdfs
一号IT男8 天前
Hive中GROUPING SETS功能详解
数据仓库·hive·hadoop