Spark 平障录

Profile

Profile 是最重要的第一环。

  • 利用好 spark UI 和 yarn container log
  • 分析业务代码,对其计算代价进行预判
  • 建设基准,进行对比,比如application id 进行对比,精确到 job DAG 环节
充分利用 UI
Stage 页面

页头 summary,也很重要。

勾选所有 UI metrics,提供判断依据
task 维度 metrics
Executor 维度
application id 对比

如果两个application id, shuflfle read/write 差不多,input/output 差不多。

慢的那一个,如果内存消耗大,那说明计算量大,比如 sum, count 等

Executor 页面

选中所有 metrics,增加判断依据

注意GC

相关推荐
用户3610588626123 小时前
Spark 核心之二次排序、分组取 TopN 优化分析
大数据·spark
头茬韭菜1 天前
Apache Fluss 项目深度分析与技术文档系列计划
flink·spark·realtime·fluss
Gent_倪2 天前
Spark聚合算法:HashAggregate与SortAggregate详解
大数据·spark
用户3610588626123 天前
Spark 核心之任务调度角色划分以及资源调度角色划分详解
大数据·spark
用户3610588626124 天前
Spark 核心之 Stage 并行度划分及优化详解
spark
用户3610588626124 天前
Spark 核心之 Stage 切分划分与计算模式详解
spark
用户3610588626125 天前
Spark 核心之 RDD 窄依赖与宽依赖详解
spark
用户3610588626125 天前
Spark 核心之 Stage 和 Task 原理剖析
spark
java1234_小锋5 天前
【免费】基于Spark实时医疗健康数据监测与疾病预测系统(Java版本+可视化大屏+Kafka+SpringBoot+Vue3) 锋哥原创出品,必属精品
大数据·spark·kafka·实时医疗健康数据监测·实时疾病预测系统
腾讯云大数据5 天前
腾讯云智能数据湖计算AI DLC发布会回顾:Spark+Ray一体化,面向Agent重构数据底座
人工智能·spark·腾讯云