Spark streaming写入delta数据湖问题

问题1 一个batch运行时间过长

检查发现问题出现在merge写文件时间过长,一个batch本来应该是控制在1min。但项目上线到生产环境,检查spark streaming的job,发现数据在merge写入到数据湖时,往往超过1小时。继续排查,发现是一张表往往出现几百个小文件,影响数据写性能,故每天进行小文件合并操作。

  • . 优化小文件问题:

    sql 复制代码
    optimize delta.`dbfs:/your_mount_path/` 
  • 增加分区:

    python 复制代码
    df = spark.read.format('delta').load("abfs:/your_history_path")
    df = df.withColumn('CDC_DATE', df['cdc_timestamp'].cast('date'))
    df.write.partitionBy('CDC_DATE').mode('overwrite').option('overwriteSchema', 'true').format('delta').save("abfs:/your_partitioin_path")
相关推荐
其实防守也摸鱼29 分钟前
内网穿透与反向代理:原理、工具与实战指南
android·大数据·运维·安全·网络安全·自动化·渗透
2603_965148111 小时前
AI+API选品:下一代智能商务助手雏形已现
java·大数据·数据库·人工智能·数据挖掘
Thomas.Sir1 小时前
第21课:PyTorch|GPU多卡训练与分布式训练基础【让多卡并行成为你的加速引擎】
人工智能·pytorch·分布式
adinnet20261 小时前
向量检索为什么能快速响应?HNSW 与 IVF_FLAT 索引怎么选
大数据·人工智能
大大大大晴天1 小时前
从规则到工单:大数据数据质量治理闭环
大数据
zhongerzixunshi1 小时前
浅析 CS 信息系统建设和服务能力评估对 IT 企业发展的价值
大数据
Cicada1282 小时前
库存消息消费的正确性设计——从幂等窗口到批量流水线
分布式·系统架构
前沿行业洞察2 小时前
号码认证的终端覆盖为什么重要?——从手机原生到全渠道展示的生态解析
大数据
JQweryuiop2 小时前
中小型游戏陪练工作室数字化管理实践:基于七彩屋电竞护航小程序订单、履约与绩效系统的落地复盘
大数据·游戏·小程序·架构
人工智能培训2 小时前
未来三年,AI 落地的五个确定性判断
大数据·人工智能·学习·生活·ai写作