hadoop 集群的常用命令

以下是一些 Hadoop 集群的常用命令,包括针对 HDFS(Hadoop 分布式文件系统)和 MapReduce 作业等方面,且相对不太常见:

HDFS 权限相关:

  • 修改文件或目录的所有者: hdfs dfs -chown [-R] <owner>[:<group>] <path> 。例如, hdfs dfs -chown -R hadoop:hadoop /user/hadoop/data , -R 选项用于递归修改目录及其子目录和文件的所有者。

  • 修改文件或目录的权限: hdfs dfs -chmod [-R] <mode> <path> 。比如, hdfs dfs -chmod -R 755 /user/hadoop/project , -R 同样用于递归操作, 755 是权限模式。

HDFS 统计信息:

  • 获取文件系统的统计信息: hdfs dfsadmin -report 。这个命令会显示集群中各个数据节点的信息,包括节点状态、存储使用情况等。

  • 显示文件或目录的磁盘空间使用情况: hdfs dfs -du [-s] [-h] <path> 。 -s 选项用于汇总指定路径下的总大小, -h 选项以人类可读的格式显示大小,如 hdfs dfs -du -s -h /user/hadoop/data 。

MapReduce 作业相关:

  • 查看 MapReduce 作业的计数器信息: yarn application -appInfo <applicationId> -counter 。可以通过作业 ID 查看作业运行过程中的各种计数器值,了解作业的执行情况。

  • 杀死一个 MapReduce 作业: yarn application -kill <applicationId> 。当发现作业异常或不需要继续运行时,可使用该命令终止作业。

Hadoop 守护进程管理:

  • 安全模式相关:进入安全模式 hdfs dfsadmin -safemode enter ,在安全模式下,HDFS 只允许读操作,用于维护集群状态;离开安全模式 hdfs dfsadmin -safemode leave 。

  • 重新加载 HDFS 的配置: hdfs dfsadmin -refreshNamenodes <datanode_host:port> 。当数据节点的配置发生变化时,可使用此命令让 NameNode 重新加载该数据节点的信息。

相关推荐
随缘而动,随遇而安2 天前
第九十八篇 工程落地视角:Session/Cookie/Token 原理辨析与大数据实战
大数据·spark·token·cookie·session
霑潇雨3 天前
Spark学习基础转换算子案例(单词计数(WordCount))
java·大数据·分布式·学习·spark·maven
zhojiew3 天前
使用 Spark Connect 在 Amazon EMR on EC2 上实现远程 Spark开发
大数据·分布式·spark
大江东去浪淘尽千古风流人物3 天前
【Kimera】MIT SPARK 实时度量-语义 SLAM 全栈解析:VIO + 鲁棒 PGO + 语义网格四模块架构与 EuRoC 实测深度剖析
大数据·架构·spark
大江东去浪淘尽千古风流人物3 天前
【Kimera-VIO】MIT SPARK 实时度量-语义 VIO/SLAM:六模块并行架构与智能因子图优化深度解析
大数据·架构·spark
大江东去浪淘尽千古风流人物3 天前
【Kimera-Semantics】实时三维语义重建深度解析:Fast/Merged 双路积分、对数概率体素 Bayesian 融合与 ROS 全链路实现
大数据·架构·spark
陆水A5 天前
运输时效预测模型:静态路由时效的计算与验证
大数据·人工智能·算法·spark·数据库开发·etl工程师
SeaTunnel5 天前
Apache SeaTunnel 4 月有何新动作?连接器增强与 Zeta 稳定性提升等亮点速览
大数据·数据仓库·spark·apache·seatunnel
淡定一生23335 天前
spark 3.3+ 之BloomFilter Runtime Filter
大数据·分布式·spark