pyspark 执行group by操作 - 原始数据非hive

前情提要

pyspark执行group by操作中,数据源是hive,而有时候我们的数据源可能是集群上的某个文件,这时候可以pyspark中使用DataFrame API来根据自动字段执行group by操作,这里还是以sum为例。

基础步骤

  1. 创建SparkSession:首先创建一个SparkSession,这是使用PySpark的入口。
  2. 示例数据:定义一些示例数据,并创建一个DataFrame。
  3. 自动字段列表:定义一个包含需要执行sum操作的字段的列表。
  4. 执行sum操作:使用DataFrame的select方法和sum函数对指定字段执行sum操作。通过列表推导式生成sum表达式列表,并使用alias方法为每个sum结果指定别名。
  5. 显示结果:使用show方法显示结果DataFrame。
  6. 停止SparkSession:最后停止SparkSession

代码示例

python 复制代码
from pyspark.sql import SparkSession
from pyspark.sql.functions import col, sum
# 创建SparkSession
spark = SparkSession.builder \
    .appName("SumOperationExample") \
    .getOrCreate()
# 示例数据
data = [
    ("Alice", 10, 20, 30),
    ("Bob", 40, 50, 60),
    ("Cathy", 70, 80, 90)
]
# 创建DataFrame
columns = ["Name", "Field1", "Field2", "Field3"]
df = spark.createDataFrame(data, columns)
# 自动字段列表
fields_to_sum = ["Field1", "Field2", "Field3"]
# 执行sum操作
sum_exprs = [sum(col(field)).alias(f"sum_{field}") for field in fields_to_sum]
result_df = df.select(sum_exprs)
# 显示结果
result_df.show()
# 停止SparkSession
spark.stop()
相关推荐
慧一居士12 小时前
Apache StreamPark 功能和使用场景介绍、使用步骤详细示例
数据仓库
牛奶咖啡1313 小时前
大数据Hadoop运维应用实践——Hadoop平台常见问题与故障汇总、系统调优、网络规划与硬件存储选型
大数据·hadoop·hadoop集群操作系统调优·hadoop集群运维问题汇总·hadoop集群硬件规划·大数据平台网络规划·大数据平台硬件存储选型
雨晨源码(同名B站)13 小时前
基于Python的网易云音乐评论数据情感化分析系统 音乐爬虫信息可视化 |SnowNLP评论情感分析
开发语言·hadoop·爬虫·python·信息可视化·毕业设计
赤土 炙焱1 天前
hiveserver2启动失败,磁盘满了
hive·hadoop
慧一居士1 天前
Hologres 功能及使用场景介绍,实践详细步骤示例
数据仓库
哥本哈士奇1 天前
dbt+SQLServer构建数据仓库(10):macro 以及 data vault的应用实例
大数据·数据仓库·sqlserver
Francek Chen2 天前
【大数据处理与分析】数据仓库Hive:02 数据湖
大数据·数据仓库·hive·hadoop·分布式·数据分析
自由能燃气设备3 天前
燃气容积式热水器厂家选购指南:2026年商用热水设备采购避坑手册
大数据·数据库·数据仓库·人工智能
哥本哈士奇3 天前
dbt+SQLServer构建数据仓库(8):Vibe Coding用dbt构建data vault数仓
数据仓库·sqlserver
Blossom i4 天前
Python+spark2.0+Hadoop机器学习与大数据实战第十一章:Python Spark的集成开发环境
大数据·hadoop·spark