Spark处理方法_提取文件名中的时间

需求描述

通过读取目录下的类似文件的datapath路径的文件名及文件内容,需要将读取的每一个文件的文件名日期解析出来,并作为读取当前文件内容递归读取当前文件一个df列,列名为"时间";后面就是读一个文件,解析一下时间,将时间添加到所读文件的dataframe中,相当于给每一个读的文件内容添加了当前读取文件解析出来的时间列,以此递归循环。读取每一个文件后都要加上一列此文件解析出来的时间,形式如下

复制代码
  Reading file: hdfs://master.test.com:8020/data/测试文件/_L_20231025095119.txt
  Reading file: hdfs://master.test.com:8020/data/测试文件/_L_20231026095119.txt
  Reading file: hdfs://master.test.com:8020/data/测试文件/_L_20231027095119.txt

内容形式如下

复制代码
  文件名:L_20231025095119.txt
  文件内容:id,imsi,lon,lat
  ......
  文件名:L_20231026095119.txt
  文件内容:id,imsi,lon,lat
  ......
  文件名:L_20231027095119.txt
  文件内容:id,imsi,lon,lat
  ......
  我要的文件内容输出形式为
  id,imsi,lon,lat,20231025095119
  ...
  id,imsi,lon,lat,20231026095119
  ...
  id,imsi,lon,lat,20231027095119
  ......

代码片段:

Scala 复制代码
...
...
//打印读取目录下的文件名
println("文件datapath路径")
if (dataPath.isEmpty) {
  println("No files to read.")
} else {
  for (path <- dataPath) {
    println(s"Reading file: $path")
  }
}
// 解析时间字段
// 提取文件名中的时间部分,格式为:"_L_20231111095119.txt" 中的 "20231111095119"
// 由于文件名是按目录读取的,因此要变成字符串形式并以逗号隔开
val filePath = dataPath.mkString(",")
val fileName = filePath.split("/").last.stripSuffix(".csv")
val timeStr = fileName.split("_").last
val year = timeStr.substring(0, 4)
val month = timeStr.substring(4, 6)
val day = timeStr.substring(6, 8)
val hour = timeStr.substring(8, 10)
val minute = timeStr.substring(10, 12)
val second = timeStr.substring(12, 14)
val time = s"$year-$month-$day $hour:$minute:$second"
println(time)
// 输出时间类似:2023-03-01 09:51:19
...
...
val rddAll = if(dataPath.isEmpty){
    sc.emptyRDD[(LongWritable,Text)]
} else {
    sc.newAPIHadoopRDD(jobConf,classOf[CombineTextInputFormat],classOf[LongWritable],classOf[Text])
    
}

val firstLine = {
    if(rddAll.take(1).length == 0){
        null
    } else {
        val firstLineTemp = rddAll.first()._2
        getAfterSplitArray(delimiter,new String(firstLineTemp.getBytes,0,firstLineTemp.getLength,encoding))
    }
}
...
...
val outDF = sqlc.createDataFrame(outRDD,schema)
//2修改
val outDF1 = outDF.withColumn("时间", lit(time))
outDF1.show()
相关推荐
盘古信息IMS14 分钟前
盘古信息IMS V6 8.0重磅发布:以薪火AI数智平台点燃离散制造数智化引擎
大数据·人工智能·制造
论文小助手W6851 小时前
【ACM出版,EI检索】2026年人工智能与智慧城市国际学术会议(IC-AISC 2026)
大数据·人工智能·全文检索·智慧城市·交通物流
盖小雅2 小时前
自动化排班如何破解劳动法合规难题:从规则冲突到可追溯的排班表
大数据·运维·机器学习·自动化
Bechamz2 小时前
大数据开发学习Day43
大数据·学习
五度易链-区域产业数字化管理平台2 小时前
大数据驱动智慧招商:五度易链园区数字化解决方案
大数据
心疼你的一切3 小时前
高效内容生产:如何实现规模化创作
大数据·人工智能·ai·ai编程·ai写作
imbackneverdie4 小时前
深耕医学科研智能化十年,MedPeer打造新一代AI生物医学科研操作系统
大数据·人工智能·ai·信息可视化·数据分析·aigc·科研
Xuantong_905 小时前
玄同科技亮相2026金砖新工业革命展览会,智启全球合作新篇
大数据·人工智能
机器学习之心7 小时前
上海原油期货收益率研究数据集说明
大数据·人工智能·上海原油期货收益率
计算机安禾7 小时前
【算法分析与设计】第19篇:二分图匹配与指派问题
大数据·人工智能·算法