部署Spark

本章探讨Spark的基础架构,了解这些有助于部署和运行Spark应用程序

  1. 集群部署的选择
  2. Spark的不同集群管理者
  3. 部署注意事项以及配置部署

在大多数情况下,Spark在各种集群管理器下的工作模式类似。然而,定制集群管理器就需要了解每个集群管理系统的工作原理,最困难的部分是选择集群管理器(或选择托管服务)

Spark有三个官方支持的集群管理器

  1. Standalone模式
  2. Hadoop Yarn模式
  3. Apache Mesos

这些集群管理器维护一组机器用于部署你的Spark应用程序,这些集群管理器对集群的管理模式各不相同

在哪里部署Spark集群

关于在哪里部署Spark集群,有两个选择:部署在本地集群或公共云中,这个选择很重要

Yarn集群管理器

Hadoop Yarn是支持作业调度和集群资源管理的框架,Spark经常被误认为是Hadoop生态系统的一部分,但事实上,Spark与Hadoop几乎没有关系,虽然Spark本身支持Hadoop Yarn集群管理器,但它并不需要Hadoop的支持

通过在spark-submit命令行参数中将master节点指定为Yarn,你可以在Hadoop Yarn上运行Spark作业,就像使用Standalone模式一样,你可以根据需求调整集群配置,由于Hadoop Yarn是大量不同执行框架的通用调度器,因此配置的参数数量自然也多于Spark的Standalone模式

提交应用程序

将应用程序提交给Yarn时,与其他部署的核心区别在于,--master需要指定的是yarn而不是master节点的IP(在Standalone模式中需要master节点IP)。Spark将使用环境变量HADOOP_CONF_DIR或YARN_CONF_DIR来查找Yarn配置文件,在将这些环境变量设置为Hadoop的安装目录后,就可以运行spark-submit来提交应用程序

有两种部署模式可用于在Yarn上启动Spark

在Yarn应用程序上配置Spark

将Spark部署为Yarn应用程序需要你了解Spark应用程序的各种不同配置及其含义。

Hadoop配置

如果想使用Spark从HDFS进行读写,则需要在Spark的classpath中包含两个Hadoop配置文件

Yarn的应用程序属性

有很多与hadoop相关的配置,也有很多与Spark不太相关的配置,他们是为了运行或保护Yarn而同时会涉及Spark的运行方式

相关推荐
开开心心就好3 小时前
批量提取PDF中的图片,直接导出原图
前端·javascript·支持向量机·智能手机·pdf·html·启发式算法
Rosanci6 小时前
谷歌浏览器插件开发实战指南:从 Hello World 到上架发布
大数据·人工智能·chrome·程序人生
m0_466525297 小时前
云从科技上线云起ModelHub:AI团队时代的模型算力基础设施
大数据·人工智能·科技
默_笙7 小时前
🏛 给 AI 配一间办公室:Harness Engineering 六大模块与它的实现
前端·javascript
蓝速科技8 小时前
会议室门牌公告通知发布选型与落地指南丨蓝速科技
大数据·运维·数据库·人工智能·科技
linux_cfan9 小时前
videojs v10 源代码系列解读:14 · 谓词守卫:在运行时安全地调用能力
前端·javascript·音视频
天若有情67311 小时前
【纯前端小工具】公历生日转农历,批量查询每年农历生日对应的公历日期(GitHub Pages在线直接用)
前端·javascript·github pages·农历转换·lunisolar·网页小工具
SelectDB11 小时前
同等资源下 Apache Doris 4.2 vs StarRocks 4.1.1:1TB SSB 与 TPC-H 性能实测
大数据·数据库·数据分析
SelectDB11 小时前
Doris vs ClickHouse:企业 OLAP 走向下一阶段,两种技术路线如何选择
大数据·数据库·数据分析
林语琛12 小时前
我写的 switch…break 被 Babel 偷偷吞了
前端·javascript·babel