【spark】远程debug spark任务(含有pyspark)

--master yarn--master client都是可以的。

shell 复制代码
spark-submit \
--master yarn \
--deploy-mode client \
--name "test-remote-debug" \
--conf "spark.driver.extraJavaOptions=-agentlib:jdwp=transport=dt_socket,server=y,suspend=n,address=5005" \
--conf "spark.executor.extraJavaOptions=-agentlib:jdwp=transport=dt_socket,server=y,suspend=n,address=*:5006" \
/home/user/test.py

idea中如下配置,当然需要配置两个debug任务并同时启动。

运行spark-submit后再在idea中debug即可。

相关推荐
阿里云大数据AI技术3 天前
Daft 多模态视频抽帧性能优化实践:从抽帧到大模型打标,一条视频理解流水线是怎么跑起来的
大数据·人工智能·spark
FserSuN4 天前
回顾Spark的概念与应用
大数据·分布式·spark
用户3610588626124 天前
SparkSQL 数据源与底层架构深度剖析
大数据·spark
用户3610588626124 天前
SparkSQL 之 DataFrame 与 DataSet 及实操演练
大数据·spark
BYSJMG4 天前
计算机毕业设计选题推荐|【基于大数据的城市噪音数据可视化分析】Spark+K-Means+FP-Growth实战
大数据·hadoop·信息可视化·spark·课程设计
starzy19904 天前
Spark 核心之 Shuffle 文件寻址详解
大数据·spark
starzy19905 天前
SparkSQL 数据源与底层架构深度剖析
大数据·分布式·架构·spark
roman_日积跬步-终至千里5 天前
【Spark与SQL网关(1)】Spark 提交模式与 Spark Thrift Server:到底在“提交”什么
大数据·sql·spark
starzy19906 天前
Spark 核心之 Spark-SortShuffle 原理深度剖析
大数据·spark
用户3610588626126 天前
Spark 核心之 Spark 内存管理深度剖析
大数据·spark