hdfs获取所有路径大小的脚本

AI提示词

帮我写个shell脚本,我会给你一个hdfs路径的txt, 你帮我拼接一下 txt路径如下: /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde1 /user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde2

读取txt, hdfs dfs -D ipc.client.fallback-to-simple-auth-allowed=true -du -s -h hdfs://rtha

拼接到这个后面

得到的结果是

hdfs dfs -D ipc.client.fallback-to-simple-auth-allowed=true -du -s -h

hdfs://rtha/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order

查询后,会得到这个结果(这个是在最后一行,因为hdfs有很多日志)

96.3 M 288.9 M hdfs://rtha/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order

把这个换算成GB,给我,保留小数点4位 输出一个csv为路径名称,GB大小

脚本

bash 复制代码
#!/bin/bash

# 传入存放HDFS路径的文本文件,执行方式:bash hdfs_size_stat.sh hdfs_path_list.txt
txt_file="$1"

# 校验入参文件是否存在
if [ ! -f "${txt_file}" ];then
    echo "错误:文件 ${txt_file} 不存在"
    exit 1
fi

# 输出csv表头
echo "hdfs_path,size_gb" > hdfs_size_result.csv

# 循环读取每一行HDFS路径
while read -r hdfs_path; do
    # 跳过空行
    if [[ -z "${hdfs_path}" ]];then
        continue
    fi

    # 拼接完整hdfs命令执行
    full_cmd="hdfs dfs -D ipc.client.fallback-to-simple-auth-allowed=true -du -s -h hdfs://rtha${hdfs_path}"
    echo "正在统计:hdfs://rtha${hdfs_path}"

    # 执行命令,取最后一行有效结果
    res_line=$(${full_cmd} 2>/dev/null | tail -n 1)

    # 提取第一列大小字符串,例如 96.3 M
    size_str=$(echo "${res_line}" | awk '{print $1,$2}')
    unit=$(echo "${res_line}" | awk '{print $2}')
    num_val=$(echo "${res_line}" | awk '{print $1}')

    # 统一换算字节数
    case ${unit} in
        B) bytes=$(echo "${num_val}" | awk '{print $1}') ;;
        K) bytes=$(echo "${num_val} * 1024" | bc -l) ;;
        M) bytes=$(echo "${num_val} * 1024 * 1024" | bc -l) ;;
        G) bytes=$(echo "${num_val} * 1024 * 1024 * 1024" | bc -l) ;;
        T) bytes=$(echo "${num_val} * 1024 * 1024 * 1024 * 1024" | bc -l) ;;
        *) bytes=0 ;;
    esac

    # 字节换算GB,保留4位小数:1GB=1024^3 Byte
    gb_size=$(echo "scale=4; ${bytes} / (1024*1024*1024)" | bc -l)

    # 写入csv
    echo "hdfs://rtha${hdfs_path},${gb_size}" >> hdfs_size_result.csv

done < "${txt_file}"

echo "执行完成,结果文件:hdfs_size_result.csv"

使用方式

使用步骤

  1. 把上面脚本保存为 hdfs_size_stat.sh
  2. 准备你的路径文本 hdfs_path_list.txt,内容:

plaintext

复制代码
/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_order
/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde1
/user/hive/warehouse/ods_s.db/rt_ppdai_pfl_transfour_tb_orde2
  1. 授权 + 运行

bash

运行

复制代码
chmod +x hdfs_size_stat.sh
bash hdfs_size_stat.sh hdfs_path_list.txt

说明

  1. 自动拼接前缀 hdfs://rtha,带上你指定的 HDFS 参数;
  2. 兼容 B/K/M/G/T 单位自动换算 GB;
  3. 结果写入 hdfs_size_result.csv,格式:完整HDFS路径,大小(GB,四位小数)
  4. 屏蔽命令报错日志,只抓取-du -s -h最后一行容量数据;
  5. 自动跳过 txt 里的空白行。
相关推荐
品牌测评2 小时前
Token Plan平台分享|七条算力订阅路径拆解
大数据·人工智能·架构
渣渣盟2 小时前
当反压问题解决后,如何进一步优化 Flink 作业的 Checkpoint 性能,让大状态作业也能稳定运行?
大数据·flink
迪康Defender2 小时前
终端邮件安全全覆盖:规则、关键词、附件白名单配置大全
大数据·人工智能·安全
中电金信2 小时前
中电金信“金融信息技术应用中试平台”入选《智能研发生产力工具选型手册》首批推荐工具
大数据·人工智能
碧口科技3 小时前
2026人力资源管理系统选型观察
大数据
redsea_HR3 小时前
红海云HR系统评测:三级国际医院HR数字化落地全程参考
大数据·人工智能
广州浮点FLOATLIC4 小时前
Mentor Graphics浮动许可证管理为什么一到流片节点就失控
java·大数据·数据库·许可证管理·cad 许可证优化
ha_lydms4 小时前
使用SQL导入MaxCompute的数据至Hologres
大数据·sql·dataworks·maxcompute·hologres·odps·datastudio
2601_949499945 小时前
硬件工程师实操:芯瑞科技两款 400G 高速互联方案参数、场景、选型全解析
大数据·运维·人工智能·科技·光模块