Spark streaming写入delta数据湖问题

问题1 一个batch运行时间过长

检查发现问题出现在merge写文件时间过长,一个batch本来应该是控制在1min。但项目上线到生产环境,检查spark streaming的job,发现数据在merge写入到数据湖时,往往超过1小时。继续排查,发现是一张表往往出现几百个小文件,影响数据写性能,故每天进行小文件合并操作。

  • . 优化小文件问题:

    sql 复制代码
    optimize delta.`dbfs:/your_mount_path/` 
  • 增加分区:

    python 复制代码
    df = spark.read.format('delta').load("abfs:/your_history_path")
    df = df.withColumn('CDC_DATE', df['cdc_timestamp'].cast('date'))
    df.write.partitionBy('CDC_DATE').mode('overwrite').option('overwriteSchema', 'true').format('delta').save("abfs:/your_partitioin_path")
相关推荐
Leo.yuan25 分钟前
2026国产数据仓库软件有哪些?从数据库、云数仓到数据集成平台一次讲清
大数据
红姐跨境书43 分钟前
高并发场景下的本地缓存进化论:从 Go sync.Map 到 BigCache 的性能调优实践
大数据
shujudang1 小时前
业务数据分析项目中的分析方法与团队协作
大数据·数据挖掘·数据分析
径硕科技JINGdigital1 小时前
Amazon Bedrock能够为企业生成式AI应用提供哪些安全与合规支持?
大数据·人工智能
当下新鲜事1 小时前
空调机房水泵常见问题解答:赛莱默B&G冷冻泵与冷却泵技术说明
大数据·运维·物联网·业界资讯
adinnet20262 小时前
为什么 RAG 需要 Milvus?向量数据库到底存了什么
大数据·数据库
Gl�ria2 小时前
Hadoop/YARN 集群缩容:下线DN节点
大数据·hadoop·分布式
Elastic 中国社区官方博客2 小时前
使用 Elasticsearch 和 Jina 进行 AI 视频搜索:精准找到你需要的视频片段秒数
大数据·数据库·人工智能·elasticsearch·搜索引擎·ai·全文检索
实验室管理云平台2 小时前
环境检测实验室管理系统:提升效率与数据准确性的关键工具
大数据·数据库·科技
Raas1002 小时前
MAI Gateway(魔芋企业级AI网关)功能全解:AI网关支持流式输出吗?一文看懂AI网关能力矩阵
大数据·人工智能·gateway·mai gateway·企业级网关