DataFrame

目录

一、创建DataFrame

在SparkSql中SparkSession是创建DataFrame和执行Sql的入口,创建DataFrame有三种方式:

  1. 通过Spark的数据源进行创建

  2. 从一个存在的RDD进行转换

  3. 从Hive Table进行查询返回

二、Sql语法

Sql语法风格是指我们查询数据的时候使用Sql语句来查询,这种风格的查询必须要有临时视图或者全局视图来辅助

注意:

普通临时表是Session范围内的,如果想应用范围内有效,可以使用全局临时表,使用全局临时表时需要全路径访问,如:global_temp.people

对于DataFrame创建一个全局表:

df.createGlobalTempView("people")

通过Sql语句实现查询全表

三、DSL语法

DataFrame提供了一个特定领域语言(domain-specific language,DSL)去管理结构化的数据,可以在Scala,Java,Python和R中使用DSL,使用DSL语法风格不必去创建临时视图了

注意:

当涉及到运算的时候,每列都必须使用$,或者采用引号表达式:单引号+字段名

起别名:

查看age大于等于30的数据:

根据 age 分组,查看数据条数

四、RDD与DataFrame互相转换

在IDEA中开发程序时,如果需要RDD与DF或者DS之间互相操作,那么需要引入:

import spark.implicits._

这里的spark不是scala中的包名,而是创建的sparkSession对象的变量名称,所以必须先创建SparkSession对象再导入,这里的spark对象不能使用var声明,因为scala只支持val修饰的对象的引入,spark-shell中无需导入,自动完成此操作

用var修饰的话,编译不通过

rdd与dataframe互相转换:

scala 复制代码
 val spark: SparkSession = SparkSession
      .builder()
      .master("local[*]")
      .getOrCreate()

    import spark.implicits._

    val rdd: RDD[Int] = spark.sparkContext.makeRDD(List(1,2,3,4,5))

    val df: DataFrame = rdd.toDF("id")

    val rdd2: RDD[Row] = df.rdd

    df.show()

    println("-" * 100)

    rdd2.collect().foreach(println)
相关推荐
PersistJiao3 小时前
Spark RDD 的宽依赖和窄依赖
spark·rdd·宽窄依赖
那一抹阳光多灿烂4 小时前
Spark中的Stage概念
大数据·spark
lisacumt9 小时前
【spark】pycharm 内使用pyspark连接有kerberos集群执行sql
python·pycharm·spark
心死翼未伤10 小时前
python从入门到精通:pyspark实战分析
开发语言·数据结构·python·spark·json
PersistJiao18 小时前
Spark RDD sortBy算子执行时进行数据 “采样”是什么意思?
spark·sortby·rangepartition
goTsHgo18 小时前
在Spark Streaming中简单实现实时用户画像系统
大数据·分布式·spark
PersistJiao19 小时前
Spark RDD(弹性分布式数据集)的深度理解
大数据·分布式·spark·rdd
那一抹阳光多灿烂19 小时前
Spark核心组件解析:Executor、RDD与缓存优化
hadoop·spark
闲人编程19 小时前
Spark使用过程中的 15 个常见问题、详细解决方案
python·ajax·spark·解决方案·调度·作业
唯余木叶下弦声1 天前
PySpark3:pyspark.sql.functions常见的60个函数
python·spark·pyspark