spark中write算子和format算子详解

在spark中,想要往数据库或者某sink路径里面写数据,存到外部存储系统,如文件系统、数据库或数据仓库,经常会用到write算子。

具体来说,write算子通常与DataFrameDataset API一起使用,用于将数据写入持久化存储。

以下是一些常见的write算子的用途和示例:

1. 写入文件系统(例如,HDFS、S3等):

Scala 复制代码
// 将DataFrame写入Parquet格式的文件
dataframe.write.parquet("/path/to/destination/folder")

2. 写入关系型数据库

Scala 复制代码
// 将DataFrame写入关系型数据库(例如,MySQL)
dataframe.write
  .format("jdbc")
  .option("url", "jdbc:mysql://hostname:port/database")
  .option("dbtable", "table_name")
  .option("user", "username")
  .option("password", "password")
  .save()

3. 写入列式数据库

Scala 复制代码
// 将DataFrame写入列式数据库(例如,Cassandra)
dataframe.write
  .format("org.apache.spark.sql.cassandra")
  .option("keyspace", "keyspace_name")
  .option("table", "table_name")
  .mode("append")
  .save()

4. 写入其他数据格式

Scala 复制代码
// 将DataFrame写入JSON格式的文件
dataframe.write.json("/path/to/destination/folder")

// 将DataFrame写入CSV格式的文件
dataframe.write.csv("/path/to/destination/folder")

这只是一小部分 write算子的示例。实际上,write算子支持多种格式和配置选项,以满足不同存储系统和需求的要求。具体的用法取决于你要写入的目标存储系统和数据格式。


那么wirte后面的format算子,这里面的参数一般有哪些常用的呢?

1. Parquet格式

Scala 复制代码
dataframe.write.format("parquet").save("/path/to/destination/folder")

2. JSON格式

Scala 复制代码
dataframe.write.format("json").save("/path/to/destination/folder")

3. CSV格式

Scala 复制代码
dataframe.write.format("csv").save("/path/to/destination/folder")

4. 关系型数据库(JDBC)

Scala 复制代码
dataframe.write.format("jdbc")
  .option("url", "jdbc:mysql://hostname:port/database")
  .option("dbtable", "table_name")
  .option("user", "username")
  .option("password", "password")
  .save()

5. 列式数据库(Cassandra)

Scala 复制代码
dataframe.write.format("org.apache.spark.sql.cassandra")
  .option("keyspace", "keyspace_name")
  .option("table", "table_name")
  .mode("append")
  .save()

6. Elasticsearch

Scala 复制代码
dataframe.write.format("org.elasticsearch.spark.sql")
  .option("es.nodes", "elasticsearch_host")
  .option("es.port", "9200")
  .option("es.resource", "index_name/document_type")
  .mode("append")
  .save()

每个存储系统或数据格式都有自己的一组特定选项,用于配置连接信息、目标路径、写入模式等。这些选项可以通过option方法进行设置,具体的选项取决于所使用的format。查阅相关文档可以帮助了解特定存储系统或数据格式所支持的选项。

相关推荐
长谷深风1111 分钟前
支付审批的智能风险控制设计
大数据·人工智能·ai·大模型·支付·aiagent·hitl
麦豆GEO6 分钟前
本地商家GEO优化落地实操方案:让AI主动推荐你的店
大数据·人工智能
宸津-代码粉碎机39 分钟前
Spring AI 高危CVE漏洞深度复盘|生产禁跑版本汇总+临时防御+修复方案
java·大数据·人工智能·python·spring
Q26433650231 小时前
【有源码】基于机器学习的电信网络诈骗话术语义识别与可视化分析系统 XGBoost算法+Hadoop+Spark
大数据·hadoop·算法·机器学习·spark·毕业设计·课程设计
千里码aicood2 小时前
面向电商冷启动与数据稀疏性的协同过滤算法优化研究
大数据·算法·协同过滤
隔窗听雨眠2 小时前
Databend Cloud化简大数据架构完全指南:从多组件堆叠到两组件架构的实践路径
大数据·架构
KANGBboy2 小时前
doris+kafka安装部署(单机+集群)二时钟服务器 java_home
服务器·分布式
KANGBboy2 小时前
doris+kafka安装部署(单机+集群)一网卡
大数据·kylin
IT研究室2 小时前
最新大数据毕业设计选题推荐-基于大数据的酵母菌蛋白质细胞定位数据分析与可视化-大数据-Spark-Hadoop-Bigdata
大数据·数据分析·课程设计
知福致福2 小时前
【技术复盘】Git 分支污染与提交污染事故排查与解法
大数据·git·elasticsearch