Spark-SQL编程

  1. Spark-SQL连接Hive

连接方式概述:Spark SQL编译时可选择包含Hive支持,包含后能支持Hive表访问、UDF、HQL等功能,且无需事先安装Hive。连接方式有内嵌Hive、外部Hive、Spark-SQL CLI、Spark beeline及代码操作。

具体连接方式

内嵌Hive:使用时无需额外操作,但实际生产中很少使用。

外部Hive:在spark-shell中连接外部Hive,需拷贝hive-site.xml到conf/目录并修改连接地址,将MySQL驱动拷贝到jars/目录,拷贝core-site.xml和hdfs-site.xml到conf/目录,最后重启spark-shell。

Spark beeline:Spark Thrift Server兼容HiveServer2,可使用hive的beeline访问。连接步骤与连接外部Hive类似,还需启动Thrift Server,再用beeline连接。

Spark-SQL CLI:可在本地运行Hive元数据服务并执行查询任务。将mysql驱动和hive-site.xml分别放入jars/和conf/目录,运行bin/目录下的spark-sql.cmd即可。

代码操作Hive:导入spark-hive_2.12和hive-exec依赖,将hive-site.xml拷贝到项目resources目录。代码中创建SparkSession时启用Hive支持,可执行Hive相关操作。若出现权限问题,可设置HADOOP_USER_NAME解决;还可通过配置spark.sql.warehouse.dir指定数据库仓库地址。

  1. 统计有效数据条数及用户数量最多的前二十个地址

实验内容:利用Spark-SQL统计有效数据(uid、phone、addr字段均无空值)条数,并找出用户数量最多的前二十个地址。

数据处理思路:数据为json格式,需用get_json_object函数转换格式后分析处理。

代码示例(Scala)

scala

import org.apache.spark.sql.SparkSession

import org.apache.spark.sql.functions.get_json_object

object SparkSQLExperiment {

def main(args: Array[String]): Unit = {

val spark = SparkSession.builder()

.appName("SparkSQLExperiment")

.master("local[*]")

.getOrCreate()

// 读取json数据

val df = spark.read.json("path/to/your/json/data.json")

// 提取字段并过滤有效数据

val validData = df.select(

get_json_object("value", ".uid").alias("uid"),

get_json_object("value", ".phone").alias("phone"),

get_json_object("value", ".addr").alias("addr")

).filter("uid".isNotNull \&\& "phone".isNotNull && $"addr".isNotNull)

// 统计有效数据条数

val validDataCount = validData.count()

println(s"有效数据条数: $validDataCount")

// 按地址分组统计用户数量并取前二十

val top20Addrs = validData.groupBy("addr").count().orderBy($"count".desc).limit(20)

top20Addrs.show()

spark.stop()

}

}

相关推荐
num_killer11 分钟前
小白的Spark初识(RDD)
大数据·分布式·spark
红队it2 小时前
【Spark+Hadoop】基于spark+hadoop游戏评论数据分析可视化大屏(完整系统源码+数据库+开发笔记+详细部署教程+虚拟机分布式启动教程)✅
大数据·hadoop·分布式·算法·游戏·数据分析·spark
oMcLin2 小时前
如何在CentOS 8上配置并调优Apache Spark集群,确保大规模数据分析任务的高效运行与资源分配?
spark·centos·apache
俊哥大数据2 小时前
【项目9】 基于Spark网站流量日志大数据实时分析系统
大数据·分布式·spark
Light602 天前
从“报告”到“能力”——构建智能化、可审计的数据治理闭环——领码 SPARK 数据质量平台白皮书
大数据·分布式·spark
火龙谷2 天前
day2-采集数据
spark
大厂技术总监下海3 天前
从Hadoop MapReduce到Apache Spark:一场由“磁盘”到“内存”的速度与范式革命
大数据·hadoop·spark·开源
麦麦大数据3 天前
F052pro 基于spark推荐的中医古籍知识图谱可视化推荐系统|spark mlib|hadoop|docker集群
docker·spark-ml·spark·知识图谱·可是还·中医推荐·ehcarts
巧克力味的桃子4 天前
Spark 课程核心知识点复习汇总
大数据·分布式·spark
Light604 天前
智能重构人货场:领码SPARK破解快消行业增长困局的全景解决方案
spark·数字化转型·ai大模型·智能营销·快消行业·供应链优化