Spark 平障录

Profile

Profile 是最重要的第一环。

  • 利用好 spark UI 和 yarn container log
  • 分析业务代码,对其计算代价进行预判
  • 建设基准,进行对比,比如application id 进行对比,精确到 job DAG 环节
充分利用 UI
Stage 页面

页头 summary,也很重要。

勾选所有 UI metrics,提供判断依据
task 维度 metrics
Executor 维度
application id 对比

如果两个application id, shuflfle read/write 差不多,input/output 差不多。

慢的那一个,如果内存消耗大,那说明计算量大,比如 sum, count 等

Executor 页面

选中所有 metrics,增加判断依据

注意GC

相关推荐
阿里云大数据AI技术4 小时前
从 Common Crawl 到可训练语料:用 EMR Serverless Daft 构建清洗、模型标注与向量化管线
人工智能·spark
凉凉的知识库5 小时前
一文讲清 Spark 集群队列:YARN 多租户、容量隔离与资源共享
大数据·spark·yarn
markvivv6 小时前
【译】适合在RTX 5090、DGX Spark或类似机器上可运行的最佳新模型是什么?
大数据·人工智能·spark
FYKJ_20107 小时前
django学习成绩预警系统10905
java·javascript·spring boot·python·spark·django·php
逸Y 仙X7 小时前
Spark SQL
java·大数据·sql·spark
starzy19908 小时前
SparkStreaming 之接收数据原理剖析
大数据·spark
用户3610588626121 天前
SparkSQL 之 Hive On Spark 原理分析
大数据·spark
for_ever_love__1 天前
PySpark学习: PySpark数据计算
python·学习·spark
董可伦1 天前
Spark 源码 | Standalone Cluster 模式提交流程(八)
spark·源码
for_ever_love__1 天前
PySpark学习: 数据输出
开发语言·python·学习·spark