Spark streaming写入delta数据湖问题

问题1 一个batch运行时间过长

检查发现问题出现在merge写文件时间过长,一个batch本来应该是控制在1min。但项目上线到生产环境,检查spark streaming的job,发现数据在merge写入到数据湖时,往往超过1小时。继续排查,发现是一张表往往出现几百个小文件,影响数据写性能,故每天进行小文件合并操作。

  • . 优化小文件问题:

    sql 复制代码
    optimize delta.`dbfs:/your_mount_path/` 
  • 增加分区:

    python 复制代码
    df = spark.read.format('delta').load("abfs:/your_history_path")
    df = df.withColumn('CDC_DATE', df['cdc_timestamp'].cast('date'))
    df.write.partitionBy('CDC_DATE').mode('overwrite').option('overwriteSchema', 'true').format('delta').save("abfs:/your_partitioin_path")
相关推荐
starzy19901 小时前
SparkStreaming 之 Direct 模式深度剖析
大数据·spark
金立基包装胶水1 小时前
纸袋热封频繁不良,先排查胶料这一堆问题
大数据·笔记·其他
VALENIAN瓦伦尼安教学设备2 小时前
设备状态检测振动分析实训台案例分析
大数据·数据库·人工智能·嵌入式硬件·算法
飞飞传输3 小时前
国产化 MOVEit 替代:文件传输架构与安全能力深度解读
大数据·运维·安全
LONGZETECH3 小时前
低空经济背景下:五组核心数据拆解无人机职业教育的机遇与实训破局
大数据·人工智能·系统架构·无人机
大大大大晴天4 小时前
大数据上 K8s 的三种运行范式:离线计算、实时流处理与分析服务
大数据
程序员小八7774 小时前
Agent 沙箱:给 AI 的「手」套上缰绳
大数据
硬件工艺分享君4 小时前
PCB厂家如何守住交期、品质与响应
大数据·运维·科技·制造·pcb工艺
Shulex4 小时前
电商 AI 客服接管率怎么提升?从指标口径到转人工规则
大数据·人工智能·智能客服·跨境电商
科技研学社4 小时前
2026-2028全球工作服夹克智能制造发展趋势与海外工厂布局报告
大数据·人工智能