Hadoop3:HDFS的Shell操作(常用命令汇总)

一、简介

什么是HDFSShell操作?

很简单,就是在Linux的终端,通过命令来操作HDFS

如果,你们学习过git、docker、k8s,应该会发现,这些命令的特点和shell命令非常相似

二、常用命令

1、准备工作相关命令

启动集群

bash 复制代码
sbin/start-dfs.sh
sbin/start-yarn.sh

查看命令帮助

bash 复制代码
hadoop fs -help rm

创建/sanguo文件夹

bash 复制代码
hadoop fs -mkdir /sanguo

2、上传

1、-moveFromLocal:从本地剪切粘贴到HDFS

bash 复制代码
hadoop fs -moveFromLocal ./shuguo.txt /sanguo

2、-copyFromLocal:从本地拷贝文件到HDFS指定路径中

bash 复制代码
hadoop fs -copyFromLocal ./weiguo.txt /sanguo

3、-put:等同于 copyFromLocal,生产环境更习惯用 put

bash 复制代码
hadoop fs -put ./wuguo.txt /sanguo

4、-appendToFile:追加一个文件中的内容HDFS中已经存在的文件末尾

bash 复制代码
hadoop fs -appendToFile liubei.txt /sanguo/shuguo.txt

注意

此命令可能遇到的错误

解决办法

hdfs-site.xml文件中添加如下配置,重启Hadoop集群即可

xml 复制代码
  <property>
       <name>dfs.client.block.write.replace-datanode-on-failure.policy</name>
       <value>NEVER</value>
  </property>

参考:Hadoop的append命令报错的解决办法

3、下载

1、-copyToLocal:从HDFS拷贝到本地

bash 复制代码
hadoop fs -copyToLocal /sanguo/shuguo.txt ./

2、-get:等同于 copyToLocal,生产环境更习惯用 get

bash 复制代码
hadoop fs -get /sanguo/shuguo.txt ./shuguo2.txt

4、文件的常用操作

1、-ls: 显示目录信息

bash 复制代码
hadoop fs -ls /sanguo

2、-cat:显示文件内容

bash 复制代码
hadoop fs -cat /sanguo/shuguo.txt

3、-chgrp、 -chmod、 -chown :同Linux文件系统中的用法一样,修改文件所属权限

bash 复制代码
hadoop fs -chmod 777 /sanguo/shuguo.txt

4、-mkdir:创建路径

bash 复制代码
hadoop fs -mkdir /jinguo

5、-cp:从HDFS的一个路径拷贝HDFS的另一个路径

bash 复制代码
hadoop fs -cp /sanguo/shuguo.txt /jinguo

6、-mv:在HDFS目录中移动(剪切)文件

bash 复制代码
hadoop fs -mv /sanguo/weiguo.txt /jinguo

7、-tail:显示一个文件的末尾1kb的数据

bash 复制代码
hadoop fs -tail /jinguo/shuguo.txt

8、-rm:删除文件或文件夹

bash 复制代码
hadoop fs -rm /sanguo/shuguo.txt

9、-rm -r 递归删除目录及目录里面的文件

bash 复制代码
hadoop fs -rm -r /sanguo

10、-du统计文件夹的大小信息

bash 复制代码
hadoop fs -du -s -h /jinguo
hadoop fs -du -h /jinguo

说明: 27表示一个节点上文件大小;81表示27*3个副本的总大小;/jinguo表示查看的目录

11、-setrep:设置HDFS中文件的副本数量

bash 复制代码
hadoop fs -setrep 10 /jinguo/shuguo.txt

这里设置的副本数只是记录在NameNode元数据中,是否真的会有这么多副本,还得看DataNode的数量。因为目前只有 3台 设备,最多也就 3个 副本,只有节点数的增加到10台时副本数才能达到10个,当然,节点数超过10个,副本数也只能是10个。

相关推荐
2601_9648402718 分钟前
4G云门禁普惠化技术实践:基于边缘计算破解成本、隐私、部署三大行业瓶颈
大数据·人工智能·边缘计算
具身智能进化论1 小时前
国产协作机器人品牌如何选择,企业长期使用更看重什么
大数据·人工智能·机器人·工厂方法模式
IvorySQL2 小时前
PostgreSQL 日报|PG18.5 回归测试崩溃问题(8 月 12 日)
大数据·数据库·人工智能·postgresql
明航咨询_贾老师2 小时前
《软件工程造价师报考全攻略:报名条件、考试流程与通关要点》
大数据·软件工程造价师
2503_931712482 小时前
国内广东乐运科技及行业头部AI数字化转型解决方案源头
大数据
学着改变2752 小时前
手持式超声波流量计为何首选行澳科技?便携巡检与外夹计量的性能标杆
大数据·网络·人工智能·科技·产品运营·量子计算
xushichang123_3 小时前
企业想统一接入 Claude、GPT、DeepSeek、Qwen 等模型,应该选什么云上 AI 平台架构?
大数据
赟爸5 小时前
直播切片素材杂乱不好复用,易元AI要怎么处理
大数据·人工智能·python
yunlaodacom5 小时前
阿里云国际站注册:性能损耗 < 1%!基于 eBPF 的服务器异常预测实战与调优指南
大数据·服务器·阿里云
大大大大晴天5 小时前
从 Kafka 到报表:Flink、CDC 与 StarRocks 的实时入仓链路
大数据