从0开始学习pyspark--pyspark的启动模式[第1节]

PySpark是Apache Spark的Python API,它能够在分布式计算环境中处理大规模数据。PySpark可以在几种不同的模式下运行,主要包括以下三种:

  1. 本地模式(Local Mode)
  2. 集群模式(Cluster Mode)
  3. 客户端模式(Client Mode)

1. 本地模式(Local Mode)

在本地模式下,PySpark在单台机器上运行。它非常适合于开发、测试和调试小规模的应用程序。使用本地模式时,所有Spark组件都运行在同一进程中,因此没有网络开销。

特点:

  • 适用于开发和调试。
  • 不需要集群设置。
  • 使用简单,配置较少。
  • 性能受限于单台机器的资源。

使用方式:

可以通过设置master参数为local来运行,例如:

python 复制代码
from pyspark.sql import SparkSession

spark = SparkSession.builder.master("local").appName("Local Mode Example").getOrCreate()

2. 集群模式(Cluster Mode)

在集群模式下,PySpark在一个分布式集群中运行,利用多个节点的资源来处理大规模数据。这是生产环境中常用的模式。集群模式又分为独立集群模式和YARN/Mesos模式。

独立集群模式(Standalone Cluster Mode)

独立集群模式是一种自带调度器的集群模式,使用Spark内置的集群管理器。

特点:

  • 易于设置和使用。
  • 适用于中小型集群。

使用方式:

启动独立集群后,可以通过设置master参数为集群的URL来运行,例如:

python 复制代码
spark = SparkSession.builder.master("spark://master:7077").appName("Standalone Mode Example").getOrCreate()
YARN/Mesos模式

YARN和Mesos是两种常用的资源管理器,可以与Spark集成,提供更强大的资源管理和调度能力。

特点:

  • 适用于大型集群和复杂的资源管理需求。
  • 支持多种工作负载和调度策略。

使用方式:

启动YARN或Mesos集群后,可以通过设置master参数为相应的URL来运行,例如:

python 复制代码
spark = SparkSession.builder.master("yarn").appName("YARN Mode Example").getOrCreate()

3. 客户端模式(Client Mode)

在客户端模式下,驱动程序(Driver Program)运行在提交Spark作业的客户端机器上,而任务(Tasks)在集群节点上运行。这种模式通常用于交互式应用程序和开发阶段。

特点:

  • 适用于交互式作业和需要实时反馈的应用。
  • 驱动程序需要与集群节点保持网络连接。

使用方式:

客户端模式通常与集群模式结合使用,通过指定deploy-mode参数为client,例如:

shell 复制代码
spark-submit --master yarn --deploy-mode client my_script.py

总结

  • 本地模式:用于开发和测试,运行在单台机器上。
  • 集群模式:用于生产环境,运行在分布式集群中,支持Standalone、YARN和Mesos。
  • 客户端模式:适用于交互式作业,驱动程序运行在客户端机器上。

这些模式的选择取决于应用程序的需求和运行环境。开发和调试阶段可以使用本地模式,而在生产环境中则通常使用集群模式。客户端模式适用于需要实时反馈的场景。

相关推荐
帅云毅17 分钟前
Web3.0的认知补充(去中心化)
笔记·学习·web3·去中心化·区块链
豆豆18 分钟前
day32 学习笔记
图像处理·笔记·opencv·学习·计算机视觉
逢生博客27 分钟前
使用 Python 项目管理工具 uv 快速创建 MCP 服务(Cherry Studio、Trae 添加 MCP 服务)
python·sqlite·uv·deepseek·trae·cherry studio·mcp服务
堕落似梦34 分钟前
Pydantic增强SQLALchemy序列化(FastAPI直接输出SQLALchemy查询集)
python
nenchoumi311939 分钟前
VLA 论文精读(十六)FP3: A 3D Foundation Policy for Robotic Manipulation
论文阅读·人工智能·笔记·学习·vln
island13141 小时前
【git#4】分支管理 -- 知识补充
大数据·git·elasticsearch
凉、介1 小时前
PCI 总线学习笔记(五)
android·linux·笔记·学习·pcie·pci
SuperSwaggySUP1 小时前
4/25 研0学习日志
学习
LCHub低代码社区1 小时前
钧瓷产业原始创新的许昌共识:技术破壁·产业再造·生态重构(一)
大数据·人工智能·维格云·ai智能体·ai自动化·大禹智库·钧瓷码
码起来呗1 小时前
基于SpringBoot的高校学习讲座预约系统-项目分享
spring boot·后端·学习