PySpark学习笔记4-共享变量,内核调度

共享变量

解决方案一-广播变量

将本地列表标记成广播变量

可以实现降低内存占用和减少网络IO传输,提高性能

python 复制代码
boradcast = sc.boardcast(stu_info_list)
value = broadcast.value

解决方案二-累加器

python 复制代码
acmlt = sc.accumulator(0)

可以收集执行器的执行结果并作用在自己的身上
Spark内核调度

DAG:有向五环图

一个action会产生一个DAG

一个DAG运行会产生一个job

一个代码运行起来包含叫做Application,包含多job

DAG和分区关联后,可以得到有分区关系的DAG图
DAG的宽窄依赖和阶段划分

窄依赖:父RDD的一个分区,将全部数据发给子RDD的一个分区

宽依赖: 父RDD的一个分区会将数据发给子RDD的多个分区

宽依赖还有一个别名shuffle

对于Spark过程,会按照宽依赖划分不同的DAG阶段,从后向前,遇到一个宽依赖就换分出一个阶段,成为stage,二每个stage的内部一定都是窄依赖
面试题1

spark怎么做内存计算的?DAG的作用?stage阶段划分的作用?

spark会使用DAG图进行内存计算,DAG图会根据分区和宽窄依赖划分阶段,每一个阶段饿的内部都是窄依赖,这些内存迭代计算的管道形成一个个具体的执行任务,一个任务对应一个线程,任务在线程中运行,就是在进行内存计算。
面试题2

spark为什么mapreduce计算效率快?

spark的算子丰富,mapreduce算子匮乏,很多复杂的人物需要多个mapreduc进行串联,通过磁盘交互数据

spark可以执行内存迭代,听过形成DAG并基于依赖划分阶段后,在阶段内可以形成内存迭代管道,但是map使用硬盘进行交互的,spark可以使用更多的内存计算而不是磁盘迭代

spark程序的调度流程如图所示

1.driver被构建出来

2.构建spark Context:执行环境入口对象

3.基于DAG调度器构建逻辑任务分配

4.基于任务调度器将逻辑任务分配到各个执行器上干活,并监控他们

5.执行器被任务调度器监控,听从他们的指令工作,并定期汇报工作进度

driver的两个重要组件:DAG调度器和task调度器

相关推荐
辰海Coding1 小时前
MiniSpring框架学习笔记-解决循环依赖的简化IoC容器
笔记·学习
晓梦林2 小时前
cp520靶场学习笔记
android·笔记·学习
心中有国也有家3 小时前
cann-recipes-infer:昇腾 NPU 推理的“菜谱集合”
经验分享·笔记·学习·算法
玄米乌龙茶1233 小时前
LLM成长笔记(三):API 开发基础
笔记
Upsy-Daisy3 小时前
AI Agent 项目学习笔记(八):Tool Calling 工具调用机制总览
人工智能·笔记·学习
LuminousCPP4 小时前
数据结构 - 线性表第四篇:C 语言通讯录优化升级全记录(踩坑 + 思考)
c语言·开发语言·数据结构·经验分享·笔记·学习
魔法阵维护师4 小时前
从零开发游戏需要学习的c#模块,第十四章(保存和加载)
学习·游戏·c#
_李小白5 小时前
【android opencv学习笔记】Day 17: 目标追踪(MeanShift)
android·opencv·学习
一只机电自动化菜鸟6 小时前
一建机电备考笔记(40) 建筑机电施工—排水管道施工(含考频+题型)
经验分享·笔记·学习·职场和发展·课程设计
2301_818730566 小时前
numpy的学习(笔记)
学习·numpy