Spark 平障录

Profile

Profile 是最重要的第一环。

  • 利用好 spark UI 和 yarn container log
  • 分析业务代码,对其计算代价进行预判
  • 建设基准,进行对比,比如application id 进行对比,精确到 job DAG 环节
充分利用 UI
Stage 页面

页头 summary,也很重要。

勾选所有 UI metrics,提供判断依据
task 维度 metrics
Executor 维度
application id 对比

如果两个application id, shuflfle read/write 差不多,input/output 差不多。

慢的那一个,如果内存消耗大,那说明计算量大,比如 sum, count 等

Executor 页面

选中所有 metrics,增加判断依据

注意GC

相关推荐
starzy19901 天前
SparkStreaming 之 Direct 模式深度剖析
大数据·spark
JLWcai202510091 天前
树脂砂轮质保与科学存放
mongodb·zookeeper·spark·memcached·storm
用户3610588626121 天前
SparkStreaming 之 DStream 底层结构剖析
大数据·spark
Code知行合壹2 天前
数据中台设计
大数据·分布式·spark
weixin_307779132 天前
PySpark根据输入的表名和过滤条件生成 INSERT 语句
python·spark·云计算·big data
阿里云大数据AI技术3 天前
一套 Spark SQL,打通多种 Catalog:EMR Serverless Spark 统一数据处理实践
人工智能·sql·spark
绿算技术3 天前
大模型本地化的经济账:DeepSeek V4 Flash 部署实测
人工智能·科技·算法·spark
伟大的大威4 天前
三台 DGX Spark 部署 DeepSeek V4 Flash NVFP4:从零到可用教程
大数据·分布式·spark
starzy19904 天前
SparkStreaming 之 updateStateByKey 算子详解及代码实现
大数据·spark