spark性能调优 | 内存优化

目录

我们先了解一下有哪些内存

scala 复制代码
 1.storage内存   存储数据,缓存         可预估
 2.shuffle内存   计算join groupby     不可预估
 spark1.6之前  静态管理的,spark1.6之后变成动态管理  默认0.5

温馨提示

在公司尽量不要写rdd(性能不好)

RDD示范(spark版本2.1.1)

我们转成rdd去跑任务,看看内存占有多大

我们也可以去excutor看内存大小

显示红色,是因为我写了while循环

RDD进行优化

看官网
https://spark.apache.org/docs/2.4.5/configuration.html#compression-and-serialization

我们采用kryo(只支持rdd)

我们需要看看rdd的缓存级别
https://spark.apache.org/docs/2.4.5/rdd-programming-guide.html#which-storage-level-to-choose

使用序列化的缓存级别

发现1.7g直接变成了270m,优化还是挺大的!

Df和Ds进行示范

看官网
https://spark.apache.org/docs/2.4.5/sql-getting-started.html#creating-datasets

Ds会专门使用自己的偏码进行序列化

内存大小34.2M

我们还可以进行序列化(变化不大)

进行优化之后33.9M

相关推荐
G311354227313 小时前
大模型不可用时,业务还能不能继续:企业需要设计降级方案
大数据·服务器·数据库·人工智能·深度学习
haoyun65432113 小时前
一文理清CRM:从基础概念到落地应用完整指南
大数据·人工智能·架构
办公室马主任14 小时前
华南机械加工企业选MES服务商怎么选?
大数据·运维·人工智能·制造
独行侠影a14 小时前
SpringBoot 分布式锁实战:Redisson 解决订单超卖并发问题
spring boot·分布式·后端
IPHWT 零软网络15 小时前
政务热线:如何打造 7x24 小时不打烊的智能总机?
大数据·人工智能·政务·智能路由·ivr语音导航
陈天伟教授16 小时前
TraeWork初体验-生成研究报告
大数据·数据库·人工智能
ZDGJ609916 小时前
一文理清国际期货各大品类
大数据·区块链
保卫大狮兄17 小时前
设备利用率低,到底是设备问题还是排产问题?
大数据·运维·服务器
大大大大晴天️17 小时前
StarRocks 的查询性能为什么快?
大数据·starrocks
专注API从业者17 小时前
告别人工盯品!Open Claw 搭建京东商品全自动监控与数据分析系统(附完整可运行代码)
大数据·数据库·数据分析