大数据学习(29)-spark on yarn底层原理

&&大数据学习&&

🔥系列专栏: 👑哲学语录: 承认自己的无知,乃是开启智慧的大门

💖如果觉得博主的文章还不错的话,请点赞👍+收藏⭐️+留言📝支持一下博主哦🤞


Spark on Yarn的底层原理以下几个方面:

  1. 资源申请与调度:Spark通过YARN的接口向ResourceManager申请资源。ResourceManager根据集群的状态和应用程序的需求,为Spark分配相应的资源。Spark接收到资源后,通过YARN的接口与NodeManager通信,请求启动任务。
  2. 任务分配与执行:Spark ApplicationMaster启动后,会向ResourceManager注册并获取任务。然后,ApplicationMaster会根据任务的依赖关系和执行顺序,将任务分配给各个NodeManager执行。NodeManager负责启动和监控任务,并将任务的执行状态和结果报告给ApplicationMaster。
  3. 容错机制:YARN提供了容错机制,当某个NodeManager出现故障时,ResourceManager会重新为Spark分配资源,确保任务能够正常运行。
  4. 资源回收:当Spark应用程序完成后,ApplicationMaster会向ResourceManager注销,并释放资源。ResourceManager会将资源回收并重新分配给其他应用程序使用。

总的来说,Spark on Yarn的底层原理是通过YARN的资源管理和调度机制,为Spark应用程序提供资源分配、任务执行和容错处理等功能。

相关推荐
HAYDENR4 小时前
依赖数据迁移工具做增量同步有哪些易错点?调整数据迁移工具策略怎么保证断点续传可靠?
java·大数据·数据库
乌恩大侠4 小时前
图解 AI-RAN开发需要哪些软硬件:O-RU、DGX Spark、Sionna与Aerial
人工智能·spark·o-ru·ai-ran
中电金信4 小时前
中电金信 :一站式企业智能体柔性生产全链路解决方案
大数据·人工智能
Jlzn88884 小时前
轻量化与高可靠性的平衡之道:CCS集成母排产线关键工艺解析
大数据·网络·物联网
观远数据4 小时前
跨部门BI落地的核心:如何做好数据集权限治理消除数据孤岛
大数据·人工智能
碧口科技4 小时前
合规打底 价值锚定:博彦科技FDE模式打通金融AI境内外规模化落地路径
大数据
天行健,君子而铎5 小时前
场景化适配+合规审查+技术突破:运营商AI数据分类分级最优解决方案
大数据·安全
leisoo809713 小时前
100GBA股股票数据怎么存ClickHouseRedisMySQLJSON完整对比
大数据·linux·服务器·开发语言·python
AI产品测评官13 小时前
突破系统割裂困局:2026企业级AI招聘架构如何迈向“原生全流程”?
大数据·微服务·架构
梦梦代码精13 小时前
连锁品牌数字化:从门店扩张到用户资产运营的技术底座
大数据·人工智能·低代码·docker·开源·代码规范