awk处理xml文件&&封装集合变量和调用

对于Hadoop配置本地存储路径:

<property><name>dfs.datanode.data.dir</name><value>file:///dfs/data</value></property>

<property>

<name>dfs.datanode.data.dir</name>

<value>file:///mnt/datadir1/data,/mnt/datadir2/data,/mnt/datadir3/data</value>

</property>

  • 可以严格按照XML换行和缩进格式配置,也可以配置到一行中;
  • 可以带file://前缀也可以不带;

注: 在 Hadoop 的配置中,dfs.datanode.data.dir 是用来指定本地文件系统上的目录路径。默认情况下,Hadoop 会将这些路径解释为本地文件系统上的路径,因此不需要显式地添加 file:/// 前缀。

awk是行处理工具,那么如何处理这种结构化的数据块呢?并且要兼顾单行和多行配置。

其实也不难。。

bash 复制代码
sudo cat "$hadoop_conf/hdfs-site.xml" | awk '
  /<name>dfs.datanode.data.dir<\/name>/ {
    if($0!~/<value>/){getline}     #如果<name>节点上没有<value>子节点,读取下一行
    sub(/.*<value>/, "")           #剔除<value>及之前的空行
    sub(/<\/value>.*/, "")         #剔除</value>及之后的空行
    sub(/file:\/\//, "")           #剔除file://前缀
    gsub(/,/, "\n")                #将以逗号分割的多个目录换行打印
    print
}'

效果如下:

如果集合不直接打印,而是要封装成集合,以待后续处理呢?

bash 复制代码
sudo cat "$hadoop_conf/hdfs-site.xml" | awk '
  /<name>dfs.datanode.data.dir<\/name>/ {
    if($0!~/<value>/){getline}
    sub(/.*<value>/, "")
    sub(/<\/value>.*/, "") 
    sub(/file:\/\//, "") 
    split($0, paths, /,/)
    for (i in paths){
      result[count++] = paths[i]
    }
}END {
    # 打印数组内容
    for (i = 0; i < length(result); i++) {
      print result[i]
    }

}'

这里为啥要将paths集合中的数据倒腾到result数组中,知道为啥吗?

效果如下:

相关推荐
Mikowoo00716 小时前
批量汇总XML格式的发票信息
xml·python
逃逸线LOF1 天前
xml文件如何加载properties文件(spring容器加载properties文件)
xml
至乐活着2 天前
Shell脚本编写最佳实践:打造健壮、可维护的自动化利器
自动化·bash·shell·脚本·最佳实践
前网易架构师-高司机4 天前
带标注的山体滑坡塌方数据集数据集,识别率78.1%,974张图,支持yolo,coco json,voc xml,文末有模型训练代码
xml·yolo·json·数据集·自然灾害·山体滑坡
程序媛kelly4 天前
.xml / .jrxml 文件怎么打开?OpenFiles 实测预览、编辑、搜索与 AI 摘要排查流程
xml·人工智能·jrxml
潘潘的嵌入式日记4 天前
改完Keil工程文件被缓存覆盖?——uvprojx编辑的进阶四坑
xml·嵌入式·keil·调试·mdk·工程文件
Full Stack Developme4 天前
Flowable XML标签大全
xml
阿宇的技术日志4 天前
Shell、Terminal、CLI 三者清晰区分
shell·cli·terminal
C137的本贾尼5 天前
第九篇:微服务与分布式——把一个大系统拆成多个小服务
xml·spring boot·后端
JustNow_Man8 天前
【Claude Code】 中给 Python + XML 项目建立可靠验证体系
xml·linux·python