spark-sql 备忘录

wordcount

bash 复制代码
sc.textFile("../data/data.txt").flatMap(_.split(" ")).map((_,1)).reduceByKey(_+_).collect

读取json 文件 并通过sql 执行 join 查询

java 复制代码
public static void main(String[] args) {
        SparkSession session = SparkSession.builder().master("local")
                .appName("master").getOrCreate();
        Dataset<Row> df = session.read().json("./data/user2.json");
//        json.show();
        df.createOrReplaceTempView("user");

        Dataset<Row> df2 = session.read().json("./data/dept.json");
        df2.createOrReplaceTempView("dept");
        Dataset<Row> result = session.sql("select u.id,u.name,d.name dname from user u left join dept d" +
                " on u.deptno= d.id" +
                "");
//        result.show();
//        result.collectAsList().forEach(System.out::println);
       result.write().csv("data/result2");
       session.close();
    }

jdbc 导出csv

bash 复制代码
public static void main(String[] args) {
        SparkSession session = SparkSession.builder().master("local")
                .appName("master").getOrCreate();
        Properties connectionProperties = new Properties();
        connectionProperties.put("user", "root");
        connectionProperties.put("password", "root");
        Long start = System.currentTimeMillis();
        Dataset<Row> report = session.read().jdbc("jdbc:mysql://localhost:3306/test",
                "idms_user", connectionProperties).filter("createDate is not null");

        report.write().option("header", true).mode("overwrite").csv("data/idms_user");
        long end = System.currentTimeMillis();
        System.out.println("cost:" + (end - start)+"ms");
        session.close();
    }

jdbc 通过sql 查询 函数处理

java 复制代码
/*
 jdbc  通过sql 查询  函数处理
*/ 
public static void main(String[] args) {
        SparkSession session = SparkSession.builder().master("local")
                .appName("master").getOrCreate();
        Properties connectionProperties = new Properties();
        connectionProperties.put("user", "root");
        connectionProperties.put("password", "root");
        Long start = System.currentTimeMillis();
        Dataset<Row> report = session.read().jdbc("jdbc:mysql://localhost:3306/test",
                "report", connectionProperties);
        report.createOrReplaceTempView("report");

        Dataset<Row> result = session.
                sql("select id,date_format(created_at,'yyyy-MM-dd') createDate ,title " +
                        " , date_format(now(),'yyyy-MM-dd') nowDate" +
                        " ,datediff(now(),created_at) days"+
                        " from report where age>12");

        result.show();
        session.close();
    }
相关推荐
snoopyfly~4 小时前
Ubuntu 24.04 LTS 服务器配置:安装 JDK、Nginx、Redis。
java·服务器·ubuntu
JAVA学习通4 小时前
Mybatis--动态SQL
sql·tomcat·mybatis
Me4神秘5 小时前
Linux国产与国外进度对垒
linux·服务器·安全
涤生大数据6 小时前
Apache Spark 4.0:将大数据分析提升到新的水平
数据分析·spark·apache·数据开发
牛奶咖啡137 小时前
Linux系统的常用操作命令——文件远程传输、文件编辑、软件安装的四种方式
运维·服务器·软件安装·linux云计算·scp文件远程传输·vi文件编辑·设置yum的阿里云源
weixin_437398217 小时前
转Go学习笔记(2)进阶
服务器·笔记·后端·学习·架构·golang
m0_623955668 小时前
Oracle使用SQL一次性向表中插入多行数据
数据库·sql·oracle
tan77º8 小时前
【Linux网络编程】Socket - UDP
linux·服务器·网络·c++·udp
xufwind9 小时前
spark standlone 集群离线安装
大数据·分布式·spark
szxinmai主板定制专家9 小时前
【精密测量】基于ARM+FPGA的多路光栅信号采集方案
服务器·arm开发·人工智能·嵌入式硬件·fpga开发