PySpark学习: 数据输出

文章目录

  • [PySpark 数据输出](#PySpark 数据输出)
    • [将 RDD 转换为 python 对象](#将 RDD 转换为 python 对象)
      • [collect 算子](#collect 算子)
      • [reduce 算子](#reduce 算子)
      • [take 算子](#take 算子)
      • [count 算子](#count 算子)
    • [将 RDD 内容输出到文件中](#将 RDD 内容输出到文件中)
      • [saveAsTextFile 算子](#saveAsTextFile 算子)
        • [修改 rdd 分区为 1](#修改 rdd 分区为 1)
          • [方式 1: SparkConf 对象设置属性全局并行度为 1](#方式 1: SparkConf 对象设置属性全局并行度为 1)
          • [方式二: 创建 RDD 的时候设置 (parallelize方法传入 numSlices 参数为 1)](#方式二: 创建 RDD 的时候设置 (parallelize方法传入 numSlices 参数为 1))

PySpark 数据输出

将 RDD 转换为 python 对象

collect 算子

功能: 将 RDD 各个分区内的数据, 统一收集到Driver 中, 形成一个 LIst 对象

用法:

python 复制代码
rdd.collect()

返回值是一个 列表

python 复制代码
from pyspark.sql import SparkSession
spark = SparkSession.builder.master("local").appName("SparkName").getOrCreate()
sc = spark.sparkContext

rdd = sc.parallelize((('a', 1), ('b', 3), ('c', 9), ('d', 7), ('e', 5)))
rdd2 = rdd.sortBy(lambda x: x[1], ascending=False, numPartitions=3)
print(rdd2.collect()) # [('c', 9), ('d', 7), ('e', 5), ('b', 3), ('a', 1)]

reduce 算子

功能: 对RDD对象根据传入的逻辑进行聚合

语法:

python 复制代码
rdd.reduce(func) 
# func: (T, T) -> T
# 传入 2 个参数, 1 个返回值, 返回值和参数要求类型一致
python 复制代码
from pyspark.sql import SparkSession
spark = SparkSession.builder.master("local[*]").appName("Spark_test").getOrCreate()
sc = spark.sparkContext

# 准备 RDD
rdd = sc.parallelize([1, 2, 3, 4, 5])

# reduce 算子,输出为list对象
num = rdd.reduce(lambda x, y: x + y)
print(num) # 15

take 算子

功能: 取出 RDD 的前 N 个元素, 组成 list 返回

python 复制代码
from pyspark.sql import SparkSession
spark = SparkSession.builder.master("local").appName("PySpark").getOrCreate()
sc = spark.sparkContext

rdd = sc.parallelize([1, 2, 3, 4, 5])
num = rdd.take(3)
print(num) # [1, 2, 3]

result = rdd.take(rdd.count())
print(result) # [1, 2, 3, 4, 5]

count 算子

功能: 计算RDD 有多少条数据, 返回值是一个数字

python 复制代码
from pyspark.sql import SparkSession
spark = SparkSession.builder.master("local").appName("PySpark").getOrCreate()
sc = spark.sparkContext

rdd = sc.parallelize([1, 2, 3, 4, 5])
count = rdd.count()
print(count) # 5

将 RDD 内容输出到文件中

saveAsTextFile 算子

功能: 将 RDD 的数据写入文本文件中 , 支持本地写入, hdfs 等文件系统

python 复制代码
from pyspark.sql import SparkSession
spark = SparkSession.builder.master("local[*]").appName("Spark_test").getOrCreate()
sc = spark.sparkContext

rdd = sc.parallelize([1, 2, 3, 4,5])
rdd.saveAsTextFile("Spark_test.txt")
spark.stop()
修改 rdd 分区为 1
方式 1: SparkConf 对象设置属性全局并行度为 1
python 复制代码
from pyspark.sql import SparkSession
spark = SparkSession.builder.master("local[*]").appName("Spark_test").getOrCreate() 

# 加上这一行
spark.conf.set("spark.default.parallelism", "1")

sc = spark.sparkContext 

这种写法也可以写在spark的创建步骤中

python 复制代码
spark = SparkSession.builder.master("local[*]").appName("Spark_test").config("spark.default.parallelism", "1").getOrCreate()
方式二: 创建 RDD 的时候设置 (parallelize方法传入 numSlices 参数为 1)
python 复制代码
rdd = sc.parallelize([1, 2, 3, 4,5], numSlices = 1) 

rdd = sc.parallelize([1, 2, 3, 4,5], 1) 
相关推荐
PHP实战开发录1 小时前
PHP脚本手动能跑定时任务却失败
开发语言·php·开发
郝学胜-神的一滴2 小时前
Effective Python 条款 10 :海象运算符_=
开发语言·python·程序人生·开源
wuyk5552 小时前
Python零基础入门第十四章:异常处理(try-except)
开发语言·python
2601_962078192 小时前
Appium+Python+pytest自动化测试框架详解
自动化测试·python·appium·pytest·移动应用
wuyk5552 小时前
【Socket 进阶之路】第 3 章 TCP 三次握手 & 四次挥手深度剖析|连接建立、断开、状态机、TIME_WAIT 核心工程问题
服务器·开发语言·网络·物联网·网络协议·tcp/ip
卷无止境6 小时前
智能体开发环境ADE浅析,编程工具的下一次范式跃迁
后端·python
彧azz8 小时前
图的存储结构详解:邻接矩阵的原理、实现与应用
开发语言·数据结构·学习·php
平头哥AI8 小时前
Day 22 _ 包装错误别丢链_%w、errors.Is 与 errors.As
android·服务器·学习·golang·go
嵌入式学习菌9 小时前
Modbus‑RTU 数据类型分析
开发语言·单片机·bug
一阵寒风9 小时前
CAM智能化助力PCB 智能制造-培训体系第六章.项目开发学习
学习·制造