spark Mysql数据库配置

以下是 Spark 连接 MySQL 数据库的核心配置步骤(纯文本版):

  1. 准备 MySQL JDBC 驱动
  • 下载驱动:从 Maven 仓库 下载与 MySQL 服务端版本匹配的 mysql-connector-java-X.X.XX.jar (如 MySQL 8.0 对应 8.0.33 版本)。

  • 部署驱动:

  • 单机模式:将驱动包放入 Spark 的 jars 目录(路径: $SPARK_HOME/jars/ )。

  • 集群模式:提交任务时用 --jars 参数指定驱动路径,例如:

bash

spark-submit --jars /path/to/mysql-connector-java.jar your_app.jar

  1. 构建 SparkSession 并配置连接参数

以 Scala 为例,核心代码如下:

scala

import org.apache.spark.sql.SparkSession

val spark = SparkSession.builder()

.appName("Spark MySQL Example")

.master("local[*]") // 或集群地址(如 yarn)

.getOrCreate()

// 连接参数(需替换为实际信息)

val jdbcUrl = "jdbc:mysql://host:port/database?useUnicode=true&characterEncoding=utf-8"

val table = "your_table"

val prop = new java.util.Properties()

prop.setProperty("user", "your_username")

prop.setProperty("password", "your_password")

prop.setProperty("driver", "com.mysql.cj.jdbc.Driver") // MySQL 8+ 驱动类名

  1. 读取 MySQL 数据

scala

// 读取表数据为 DataFrame

val df = spark.read.jdbc(jdbcUrl, table, prop)

df.show()

  1. 写入数据到 MySQL

scala

// 将 DataFrame 写入 MySQL 表(模式:overwrite/append/ignore/failIfExists)

df.write.jdbc(

url = jdbcUrl,

table = "target_table",

mode = "overwrite",

properties = prop

)

关键注意事项

  1. 驱动版本匹配:
  • MySQL 5.x 驱动类名为 com.mysql.jdbc.Driver ,8.x 及以上为 com.mysql.cj.jdbc.Driver 。

  • 若报 ClassNotFoundException ,检查驱动是否正确部署或版本是否匹配。

  1. 字符集配置:
  • 在 jdbcUrl 中添加 ?useUnicode=true&characterEncoding=utf-8 ,避免中文乱码。
  1. 集群环境权限:
  • 确保所有节点均能访问驱动包,或通过分布式文件系统(如 HDFS)分发驱动。

如需更详细示例(如 Python 版本或分区读取),可补充说明场景!

相关推荐
Lansonli12 小时前
大数据Spark(八十):Action行动算子fold和aggregate使用案例
大数据·分布式·spark
鸿乃江边鸟2 天前
Spark Datafusion Comet 向量化Rust Native--CometShuffleExchangeExec怎么控制读写
大数据·rust·spark·native
伟大的大威2 天前
NVIDIA DGX Spark (ARM64/Blackwell) Kubernetes 集群 + GPU Operator 完整部署指南
大数据·spark·kubernetes
小邓睡不饱耶2 天前
深度实战:Spark GraphX构建用户信任网络,精准锁定高价值目标用户(含完整案例)
大数据·spark·php
B站计算机毕业设计超人3 天前
计算机毕业设计hadoop+spark+hive共享单车预测系统 共享单车数据可视化分析 大数据毕业设计(源码+LW文档+PPT+讲解)
大数据·hadoop·python·深度学习·spark·毕业设计·课程设计
B站计算机毕业设计超人3 天前
计算机毕业设计Python+Spark+Hadoop+Hive微博舆情分析 微博情感分析可视化 大数据毕业设计(源码+LW文档+PPT+讲解)
大数据·hadoop·爬虫·python·spark·cnn·课程设计
yumgpkpm3 天前
华为昇腾300T A2训练、微调Qwen过程,带保姆式命令,麒麟操作系统+鲲鹏CPU
hive·hadoop·华为·flink·spark·kafka·hbase
TTBIGDATA3 天前
【Hue】Ambari开启 Kerberos 后,Hue 使用 Spark SQL出现凭证不统一问题处理
大数据·sql·spark·ambari·kerberos·hue·bigtop
鸿乃江边鸟4 天前
Spark Datafusion Comet 向量化Rust Native--Native算子(CometNativeExec)怎么串联执行
大数据·rust·spark·native
Light604 天前
数智孪生,金流·物流全透视:构建某银行制造业贷后风控新范式—— 基于领码 SPARK 融合平台的技术解决方案
大数据·spark·数字孪生·实时监控·物联网金融·供应链风控·ai决策