Spark-SQL任务提交方式

Spark-SQL在一定程度上可以代替Hive,但一般依赖Hive的元数据,即Metastore。Spark-SQL的交互式模式可以运行bin/spark-sql进入,按照类似hive方式写SQL代码。

Spark 通过 Thrift RPC 向 Hive Metastore Service(HMS) 发请求,HMS 再去访问 MySQL 里的元数据,这种方式可以让Hive、Spark、Presto、Impala 等多种引擎共享同一套元数据,此时需要启动Hive元数据服务HMS:

shell 复制代码
hive --service metastore

使用Hive元数据时,需要将hive的配置文件hive-site.xml放到$SPARK_HOME/conf目录下或者提交作业时用--files参数指定该配置文件。配置文件内容如下:

xml 复制代码
<property>
  <name>hive.metastore.uris</name>
  <value>thrift://metastore-host:9083</value>
</property>

Spark SQL脚本任务使用spark-sql提交任务时,和Spark传统任务类似,可使用本地、Standalone、Yarn和K8S资源调度平台。提交方式如下:

shell 复制代码
# 任务提交方式:交互模式
spark-sql # 进入 Spark SQL CLI,可以直接写 SQL 语句交互式运行,本地模式
spark-sql --master local[*] # 同上
spark-sql --master yarn --deploy-mode cluster # 提交的语句在YARN集群执行
spark-sql --master k8s://https://<k8s-apiserver>:6443 \
  --conf spark.kubernetes.container.image=my-spark-image:latest \
  --deploy-mode cluster # Driver和Executor都在K8S的Pod中,client时Driver在本地

# 任务提交:指定脚本文件
spark-sql -f my.sql --conf spark.executor.memory=4g --conf spark.executor.cores=2
spark-sql --master local[*] -f my.sql # 本地模式提交脚本任务
# Standalone模式,master参数为Spark Master的RPC地址,资源分配由Master控制
spark-sql --master spark://<master>:7077 --deploy-mode client -f my.sql
# Yarn模式,client为Driver在提交节点上运行,日志直接可见,cluster为Driver在Yarn Container中运行
spark-sql --master yarn --deploy-mode cluster \
  --executor-memory 4g \
  --executor-cores 2 \
  --num-executors 20 \
  -f my.sql
相关推荐
漂着的圆木5 天前
Agent 功能参与度:Copilot 怎么算
sql·数据分析·agent·githubcopilot·度量
旺仔不是程序员5 天前
LIMIT 1:PostgreSQL 只取一行的高效查询姿势
数据库·后端·sql
IT研究室5 天前
最新大数据毕业设计选题推荐-基于大数据的信用等级数据分析与可视化-大数据-Spark-Hadoop-Bigdata
大数据·信息可视化·数据分析·spark·课程设计
知识的搬运工旺仔6 天前
唯一索引与 NULL 值:PostgreSQL 主键约束与 NULLS NOT DISTINCT
数据库·后端·sql·postgresql
想念是会呼吸的鱼6 天前
【ClickHouse 常用 SQL 语句整理】
sql·clickhouse
想念是会呼吸的鱼6 天前
MySQL 常用语法整理
sql·mysql
计算机源码社6 天前
基于大数据技术的台北市住宅价格影响因素挖掘与可视化分析-基于Python与Hadoop的台北市住宅价格数据仓库构建与可视化
大数据·hadoop·python·数据分析·spark·毕业设计·数据可视化
IT研究室6 天前
最新大数据毕业设计选题推荐-基于大数据的物流快递数据分析与可视化-大数据-Spark-Hadoop-Bigdata
大数据·信息可视化·数据分析·spark·课程设计
IT研究室6 天前
最新大数据毕业设计选题推荐-基于大数据的鲜羊肉价格分析与可视化-大数据-Spark-Hadoop-Bigdata
大数据·信息可视化·数据分析·spark·课程设计