大数据学习(32)-spark基础总结

&&大数据学习&&

🔥系列专栏: 👑哲学语录: 承认自己的无知,乃是开启智慧的大门

💖如果觉得博主的文章还不错的话,请点赞👍+收藏⭐️+留言📝支持一下博主哦🤞


Spark提供多种运行模式:

1.本地模式(单机)

本地模式就是以一个 独立的进程 ,通过其内部的 多个线程来模拟 整个Spark运行时环境

2.Standalone模式(集群)

Spark中的各个角色以 独立进程 的形式存在,并组成Spark集群环境

3.Hadoop YARN模式(集群)

Spark中的各个角色 运行在 YARN 的容器内部 ,并组成Spark集群环境

4.Kubernetes模式(容器集群)

Spark中的各个角色 运行在 Kubernetes 的容器内部 ,并组成Spark集群环境

5.云服务模式(运行在云平台上)

spark运行模式图解:

Spark中由4类角色组成整个Spark的运行时环境

. Master角色,管理整个集群的资源
类比与YARN的ResouceManager
. Worker角色,管理单个服务器的资源
类比于YARN的NodeManager
.Driver角色,管理单个Spark任务在运行的时候的工作
类比YARN日的ApplicationMaster
Executor角色,单个任务运行的时候的一堆工作者,干活的.类比于YARN的容器内运行的TASK

从2个层面划分:资源管理层面:

。管理者: Spark是Master角色,YARN是ResourceManager。工作中: Spark是Worker角色,YARN是NodeManager从任务执行层面:
·某任务管理者: Spark是Driver角色,YARN是ApplicationMaster
·某任务执行者: Spark是Executor角色,YARN是容器中运行的具体工作进程。

Spark On Yarn的本质?

Master角色由YARN的ResourceManager担任.Worker角色由YARN的NodeManager担任.

Driver角色运行在YARN容器内或提交任务的客户端进程中真正干活的Executor运行在YARN提供的容器内。

重点:

Spark On Yarn两种模式:
Client模式和Cluster模式最最本质的区别是:Driver程序运行在哪里。
Client模式:学习测试时使用,生产不推荐(要用也可以,性能略低,稳定性略低)

1.Driver运行在Client上,和集群的通信成本高。
2.Driver输出结果会在客户端显示
Cluster模式:生产环境中使用该模式
1.Driver程序在YARN集群中,和集群的通信成本低

2.Driver输出结果不能在客户端显示
3.该模式下Driver运行ApplicattionMaster这个节点上,由Yarn管理,如果出现问题,yarn会重启ApplicattionMaster(Driver)

所以在spark on yarn中提高资源利用率,在已有YARN的场景下让Spark收到YARN的调度可以更好的管控资源提高利用率并方便管理。

相关推荐
建筑工程企业管理系统2 小时前
工程计划管理软件能解决工期延误问题吗?施工节点数字化管控实操解读
大数据·软件工程·软件需求
彧azz8 小时前
图的存储结构详解:邻接矩阵的原理、实现与应用
开发语言·数据结构·学习·php
平头哥AI8 小时前
Day 22 _ 包装错误别丢链_%w、errors.Is 与 errors.As
android·服务器·学习·golang·go
AI推荐率8 小时前
想让AI在选购问题中推荐品牌,应该找什么类型的服务商?
大数据·人工智能·microsoft
一阵寒风9 小时前
CAM智能化助力PCB 智能制造-培训体系第六章.项目开发学习
学习·制造
浅思科技集9 小时前
工业生产运营软件如何选择?看端到端可见性、数据贯通与AI落地
大数据·人工智能
传奇开心果编程9 小时前
【Xilem 0.4 基础语法学与练】第15课:状态管理与 memoize 性能优化
学习·rust·前端框架
具身AGI9 小时前
视频即仿真,物理AI 人类学习路线 的下一步
人工智能·学习
浅念-9 小时前
一文吃透Git:本地操作|冲突处理|远程协作|GitFlow工作流详解
大数据·git·elasticsearch·搜索引擎·gitflow
葫三生10 小时前
《论三生原理》神话学构想与“神话历史”理论、《古史中的神话》思路异同?
大数据·人工智能·科技·深度学习·算法