spark将数据输出到hive或mysql中

hive

复制代码
启动以下服务:
start-dfs.sh
start-yarn.sh
mapred --daemon start historyserver
/opt/installs/spark/sbin/start-history-server.sh
hive-server-manager.sh start metastore

import os

from pyspark.sql import SparkSession

"""
------------------------------------------
  Description : TODO:
  SourceFile : 02、spark
  Author  : null
  Date  : 2024/11/6
-------------------------------------------
"""

if __name__ == '__main__':
    # 配置环境
    os.environ['JAVA_HOME'] = 'E:/java-configuration/jdk-8'
    # 配置Hadoop的路径,就是前面解压的那个路径
    os.environ['HADOOP_HOME'] = 'E:/applications/bigdata_config/hadoop-3.3.1/hadoop-3.3.1'
    # 配置base环境Python解析器的路径
    os.environ['PYSPARK_PYTHON'] = 'C:/Users/35741/miniconda3/python.exe'
    # 配置base环境Python解析器的路径
    os.environ['PYSPARK_DRIVER_PYTHON'] = 'C:/Users/35741/miniconda3/python.exe'

    os.environ['HADOOP_USER_NAME'] = 'root'

    spark = SparkSession.builder \
        .master("local[2]") \
        .appName("第一个sparksql案例") \
        .config("spark.sql.warehouse.dir", 'hdfs://shucang:9820/user/hive/warehouse') \
        .config('hive.metastore.uris', 'thrift://shucang:9083') \
        .config("spark.sql.shuffle.partitions", 2) \
        .enableHiveSupport() \
        .getOrCreate()

    # 此时spark已经知道hive有什么数据库 ,该数据库中有什么表了,但是没有use
    spark.sql("select * from yhdb01.sql2_1").createOrReplaceTempView("sql2_1")
    hiveDf = spark.sql("select * from sql2_1")
    
    # 写入hive的数据库中
    # 需要有库吗 ------需要 需要有这个表吗 ------ 不需要 但是记得判空 hive中没有空类型
    hiveDf.write.saveAsTable("yhdb01.sql22_1",mode="overwrite")

    spark.stop()

mysql

复制代码
# 不需要事先将表创建好

import os

from pyspark.sql import SparkSession

"""
------------------------------------------
  Description : TODO:
  SourceFile : 02、spark
  Author  : null
  Date  : 2024/11/6
-------------------------------------------
"""

if __name__ == '__main__':
    # 配置环境
    os.environ['JAVA_HOME'] = 'E:/java-configuration/jdk-8'
    # 配置Hadoop的路径,就是前面解压的那个路径
    os.environ['HADOOP_HOME'] = 'E:/applications/bigdata_config/hadoop-3.3.1/hadoop-3.3.1'
    # 配置base环境Python解析器的路径
    os.environ['PYSPARK_PYTHON'] = 'C:/Users/35741/miniconda3/python.exe'
    # 配置base环境Python解析器的路径
    os.environ['PYSPARK_DRIVER_PYTHON'] = 'C:/Users/35741/miniconda3/python.exe'

    spark = SparkSession.builder \
        .master("local[2]") \
        .appName("第一个sparksql案例") \
        .config("spark.sql.shuffle.partitions", 2) \
        .getOrCreate()
    df = spark.read.json("../../data/sql/person.json")
    df.createOrReplaceTempView("person")
    
    # 获取一个dataFrame
    dfMysql = spark.sql("""
    select * from person
    """)
    
    # 第一种方式:format
    dfMysql.write.format("jdbc") \
    .option("driver", "com.mysql.cj.jdbc.Driver") \
    .option("url", "jdbc:mysql://localhost:3306/mydb01?characterEncoding=UTF-8") \
    .option("user", "root") \
    .option("password", "root") \
    .option("dbtable", "person") \
    .save(mode="overwrite")
    # append
    
    
    
    # 第二种方式:jdbc
    dictUsername = {"user": "root", "password": "root"}
    dfMysql.write.jdbc(url="jdbc:mysql://localhost:3306/mydb01?characterEncoding=UTF-8",table="person",properties=dictUsername,mode="append")


    spark.stop()
相关推荐
丈剑走天涯1 分钟前
基于 Python 3 语法的 PyCharm 练习示例,涵盖列表操作、类型判断及数据清洗等核心知识点
windows·python·pycharm
2601_9609067212 分钟前
1X发布自己的世界模型1XWM
mysql·mongodb·rabbitmq·memcached
学习星球14 分钟前
单调栈——从“找下一个更大的“到柱状图中的最大矩形
数据库·c++·算法·leetcode·xcode
————A29 分钟前
Agent 接收用户上传文件
人工智能·笔记·python·状态模式
可乐鸡翅yeah_33 分钟前
hls.js 内存泄漏实战排查,直播 M3U8 长时间播放异常定位方案
开发语言·javascript·python·django·ecmascript·m3u8·m3u8在线
可乐鸡翅yeah_38 分钟前
第三方接口对接 M3U8 流媒体排坑实战,解决外部服务商流兼容难题
前端·javascript·python·django·html·m3u8·m3u8在线
金融小师妹42 分钟前
多因子智能推演:黄金震荡回升,杰克逊霍尔“沃什首秀”政策如何重塑金价路径的AI预测框架
大数据·人工智能·python·线性回归
阿童木写作44 分钟前
跨马翻译:AI批量图片翻译与视频字幕翻译工具推荐
人工智能·python·音视频
阿kun要赚马内1 小时前
MCP(Model Context Protocol,模型上下文协议)
人工智能·python
GoppViper1 小时前
RDF资源描述框架深度解析:语义Web的数据基石与实战逻辑
前端·数据库