spark性能调优 | 内存优化

目录

我们先了解一下有哪些内存

scala 复制代码
 1.storage内存   存储数据,缓存         可预估
 2.shuffle内存   计算join groupby     不可预估
 spark1.6之前  静态管理的,spark1.6之后变成动态管理  默认0.5

温馨提示

在公司尽量不要写rdd(性能不好)

RDD示范(spark版本2.1.1)

我们转成rdd去跑任务,看看内存占有多大

我们也可以去excutor看内存大小

显示红色,是因为我写了while循环

RDD进行优化

看官网
https://spark.apache.org/docs/2.4.5/configuration.html#compression-and-serialization

我们采用kryo(只支持rdd)

我们需要看看rdd的缓存级别
https://spark.apache.org/docs/2.4.5/rdd-programming-guide.html#which-storage-level-to-choose

使用序列化的缓存级别

发现1.7g直接变成了270m,优化还是挺大的!

Df和Ds进行示范

看官网
https://spark.apache.org/docs/2.4.5/sql-getting-started.html#creating-datasets

Ds会专门使用自己的偏码进行序列化

内存大小34.2M

我们还可以进行序列化(变化不大)

进行优化之后33.9M

相关推荐
瑞熙贝通实验室综合管理平台8 分钟前
实验动物中心|LAMS实验动物智慧管理系统标准解决方案|新一代合规化、智能化、全闭环实验动物中心数字化管控方案
大数据
Gu_WenYun10 分钟前
1+N 管家模式重塑家庭财富管理:本元家办的全周期实践路径
大数据·金融
2601_9603563824 分钟前
2027校招:数据科学与大数据技术专业应聘数字化解决方案顾问的能力准备清单
大数据
小师兄吃牛肉25 分钟前
Java 同步系列之 ZooKeeper 分布式锁
java·分布式·java-zookeeper
Aloudata26 分钟前
Metric Layer 建设指南:如何先从核心指标层启动企业语义工程
大数据·人工智能·数据分析·data agent·语义层
jerryinwuhan28 分钟前
HV-DGTF数据治理框架
大数据·人工智能
零域码客1 小时前
RAG 和微调解决的是同一类问题吗?从大模型底层全链路拆解两者的本质与选择逻辑
大数据·人工智能·机器学习·模型微调·fine-tuning·检索增强生成·llm 架构
一招合理1 小时前
互联网金融洗牌加剧,大数据风控成平台突围关键
大数据
财迅通Ai1 小时前
开拓全球合作新机遇 科兴制药亮相CPHI Milan 2026
大数据·人工智能·科兴制药
yichengerp2 小时前
国内中小电子工厂用哪个erp系统好?
大数据·运维·人工智能·云计算·制造