hdfs获取所有路径大小的脚本

AI提示词

帮我写个shell脚本,我会给你一个hdfs路径的txt, 你帮我拼接一下 txt路径如下: /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde1 /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde2

读取txt, hdfs dfs -D ipc.client.fallback-to-simple-auth-allowed=true -du -s -h hdfs://rtha

拼接到这个后面

得到的结果是

hdfs dfs -D ipc.client.fallback-to-simple-auth-allowed=true -du -s -h

hdfs://rtha/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order

查询后,会得到这个结果(这个是在最后一行,因为hdfs有很多日志)

96.3 M 288.9 M hdfs://rtha/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order

把这个换算成GB,给我,保留小数点4位 输出一个csv为路径名称,GB大小

脚本

bash 复制代码
#!/bin/bash

# 传入存放HDFS路径的文本文件,执行方式:bash hdfs_size_stat.sh hdfs_path_list.txt
txt_file="$1"

# 校验入参文件是否存在
if [ ! -f "${txt_file}" ];then
    echo "错误:文件 ${txt_file} 不存在"
    exit 1
fi

# 输出csv表头
echo "hdfs_path,size_gb" > hdfs_size_result.csv

# 循环读取每一行HDFS路径
while read -r hdfs_path; do
    # 跳过空行
    if [[ -z "${hdfs_path}" ]];then
        continue
    fi

    # 拼接完整hdfs命令执行
    full_cmd="hdfs dfs -D ipc.client.fallback-to-simple-auth-allowed=true -du -s -h hdfs://rtha${hdfs_path}"
    echo "正在统计:hdfs://rtha${hdfs_path}"

    # 执行命令,取最后一行有效结果
    res_line=$(${full_cmd} 2>/dev/null | tail -n 1)

    # 提取第一列大小字符串,例如 96.3 M
    size_str=$(echo "${res_line}" | awk '{print $1,$2}')
    unit=$(echo "${res_line}" | awk '{print $2}')
    num_val=$(echo "${res_line}" | awk '{print $1}')

    # 统一换算字节数
    case ${unit} in
        B) bytes=$(echo "${num_val}" | awk '{print $1}') ;;
        K) bytes=$(echo "${num_val} * 1024" | bc -l) ;;
        M) bytes=$(echo "${num_val} * 1024 * 1024" | bc -l) ;;
        G) bytes=$(echo "${num_val} * 1024 * 1024 * 1024" | bc -l) ;;
        T) bytes=$(echo "${num_val} * 1024 * 1024 * 1024 * 1024" | bc -l) ;;
        *) bytes=0 ;;
    esac

    # 字节换算GB,保留4位小数:1GB=1024^3 Byte
    gb_size=$(echo "scale=4; ${bytes} / (1024*1024*1024)" | bc -l)

    # 写入csv
    echo "hdfs://rtha${hdfs_path},${gb_size}" >> hdfs_size_result.csv

done < "${txt_file}"

echo "执行完成,结果文件:hdfs_size_result.csv"

使用方式

使用步骤

  1. 把上面脚本保存为 hdfs_size_stat.sh
  2. 准备你的路径文本 hdfs_path_list.txt,内容:

plaintext

复制代码
/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order
/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde1
/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde2
  1. 授权 + 运行

bash

运行

复制代码
chmod +x hdfs_size_stat.sh
bash hdfs_size_stat.sh hdfs_path_list.txt

说明

  1. 自动拼接前缀 hdfs://rtha,带上你指定的 HDFS 参数;
  2. 兼容 B/K/M/G/T 单位自动换算 GB;
  3. 结果写入 hdfs_size_result.csv,格式:完整HDFS路径,大小(GB,四位小数)
  4. 屏蔽命令报错日志,只抓取-du -s -h最后一行容量数据;
  5. 自动跳过 txt 里的空白行。
相关推荐
大大大大晴天1 小时前
从 HDFS 到对象存储:计算存储分离如何重塑云原生大数据底座
大数据
用户36105886261210 小时前
SparkStreaming 之 updateStateByKey 算子详解及代码实现
大数据·spark
咖啡屋和酒吧11 小时前
“隐性肩颈紧张”正在透支精力|没有酸痛,不代表肩颈处于健康状态
大数据·精选
港股研究社12 小时前
专注履约底座,顺丰同城在即时零售效率时代提升增长动能
大数据·人工智能
AI_yangxi14 小时前
短视频矩阵系统选哪家
大数据·人工智能·矩阵
lupai1 天前
手机在网状态接口实测效果与质量评估
大数据·python·智能手机·api接口
大模型丫丫1 天前
Hermes Agent:轻量级智能体框架实战指南
大数据·运维·服务器
大大大大晴天1 天前
每天认识一个组件:SQL网关Apache Kyuubi
大数据
2601_962218471 天前
万象生鲜系统冷链物联网接入技术实现生鲜企业温控管理数字化
大数据·运维·微服务·云原生·架构
2601_962074811 天前
大数据-264 实时数仓 - Canal MySQL的binlog研究 存储目录 变动信息 配置MySQL
大数据·数据库·mysql