spark临时文件较大问题处理

最近使用spark对ods明细表数据进行清洗,由于清洗的表数据量较大,加上集群只有5个节点,磁盘使用率也上去了,导致每次跑spark任务时,都会产生很多临时文件,是由于内存使用完了,就会把临时数据存到磁盘,导致磁盘使用率超过80%以上,spark任务就会报错,具体报错如下:

bash 复制代码
java.io.IOException: No space left on device
java.io.FileNotFoundException: /hadoop/yarn/local/usercache/root/appcache/application_1694660329536_0016/blockmgr-081bea52-e592-4759-8d20-023ae4d85cfa/23/shuffle_0_2193_0.data.1b8c66cc-b32f-46c3-9213-410972743ea4 (No space left on device)

解决方法:

修改yarn的存储路径:

YARN NodeManager Local directories

挂载到磁盘比较大的路径下:

如挂载盘在home目录下,可以使用如下路径:

bash 复制代码
/home/hadoop/yarn/local
相关推荐
长三角活动观察1 小时前
苏州独石传媒项目SOP拆解:从“金鸡湖直播”到“创客中国”,大型活动人流管控与动线设计全流程节点控制方案
大数据·人工智能·传媒
DataScope1 小时前
去哪里找行业数据?亿欧数据靠谱吗实用吗
大数据·人工智能
仓储管理员20251 小时前
不同业务场景下,如何匹配适配的WMS系统?
大数据·运维·云计算·精选
江屿风1 小时前
【STM32基础篇】【嵌入式生态问题及历史追溯】流食般投喂
大数据·开发语言·人工智能·笔记·stm32·嵌入式硬件
Lumistory2 小时前
照明工程落地效果评判与改造的实践参考
大数据·人工智能·光照贴图
AI风控技术指南2 小时前
大模型安全围栏厂商评估:以数美科技为例拆解能力、架构和 POC 指标
大数据·网络·人工智能
snpgroupcn2 小时前
SAP ECC 维护 2027 年到期:企业还能否继续使用旧系统
大数据
广西生活网2 小时前
品牌战略全面升级 原广西生活网正式更名为旭成网
大数据·生活
小刘快学习3 小时前
职业教育机构的题库答疑与学情分析,模型账怎么算清
大数据·人工智能
江瀚视野3 小时前
AperData销量2天破万,五一视界未来何在?
大数据·人工智能