Spark 平障录

Profile

Profile 是最重要的第一环。

  • 利用好 spark UI 和 yarn container log
  • 分析业务代码,对其计算代价进行预判
  • 建设基准,进行对比,比如application id 进行对比,精确到 job DAG 环节
充分利用 UI
Stage 页面

页头 summary,也很重要。

勾选所有 UI metrics,提供判断依据
task 维度 metrics
Executor 维度
application id 对比

如果两个application id, shuflfle read/write 差不多,input/output 差不多。

慢的那一个,如果内存消耗大,那说明计算量大,比如 sum, count 等

Executor 页面

选中所有 metrics,增加判断依据

注意GC

相关推荐
LitchiCheng3 小时前
轻量化微调 Qwen2.5 LoRA 训练全流程详解
大数据·人工智能·spark
董可伦1 天前
Spark 源码 | Yarn Client 模式提交流程(五)
大数据·spark
Gent_倪2 天前
万字详解:数据库、数据仓库、数据湖、湖仓一体
数据库·数据仓库·spark
2501_948106912 天前
计算机毕业设计之jsp-智慧旅游分享平台
java·开发语言·spark·汽车·课程设计·旅游
ClickHouseDB3 天前
推出 CostBench:一个用于数据仓库成本性能的开放基准
大数据·分布式·spark
李昊哲小课4 天前
spark4 集群安装
大数据·hadoop·zookeeper·spark
阿里云大数据AI技术5 天前
EMR Serverless Daft 如何简化多模态数据处理:视频抽帧、清洗、标注全流程与具身智能实践
人工智能·spark
董可伦6 天前
Spark 源码 | SparkSubmitArguments 参数解析(三)
大数据·分布式·spark
BD_Marathon7 天前
spark.sql报错
大数据·分布式·spark