RDD触发算子的使用

count

复制代码
"""
返回值int
获取总条数
"""

take

复制代码
"""
返回前几条的数据
在driver的内存中存放------------只能少量 也就是说最终会放到同一个分区中
不会自动打印
"""

foreach

复制代码
"""
遍历每一条数据------打印

foreach 会对每个分区内的元素进行并行处理
结果的顺序可能每次都不一样,输出的具体顺序是不可预测的
要想真正排序 ,要么将分区减为1 要么collect
"""

saveAsTextFile

复制代码
"""
将数据保存在外部文件(hdfs)中
生成的文件和分区数有关

"""

collect

复制代码
"""
收集数据------将RDD转化成一个列表返回

这个RDD的数据一定不能过大,如果RDD数据量很大,导致Driver内存溢出
"""

first

复制代码
"""
获取RDD中的第一个值

"""

reduce

复制代码
"""
将RDD中的每个元素按照给定的聚合函数进行聚合,返回聚合的结果
类似sum()
"""

top

复制代码
"""
获取RDD中的最大的几个
会自动排序 ,可以指定排序规则
相当于 sortBy+take
"""
# 按照某一列进行排序
.top(10, lambda a: a[1])

不写的话 应该是按照key 值进行排序

takeOrdered

复制代码
"""
获取RDD中的最小的几个
自带排序 
"""

max

其中max和top均可以返回最大值,那么区别是什么

max:

1、只返回数据集中指定列或RDD中的最大值,即单一的最大元素。

2、并不对数据进行排序,通过分布式的计算方式查找数据集中的最大值

top:

1、返回数据集中的前几个最大值,可以指定返回的数量。即使只需要一个最大值,也会以列表的形式返回。

2、对数据集进行局部排序,然后返回指定数量的最大值,因此在一定程度上会影响性能(特别是在数据量较大时)。top 方法默认返回结果是降序排列的。

复制代码
"""
获取最大值
触发算子
"""
rsRdd.max(lambda tupleA: tupleA[1])

min

复制代码
"""
获取最小值
触发算子
"""
rsRdd.min(lambda tupleA: tupleA[1])

mean

复制代码
"""
获取平均值
触发算子
"""
rsRdd.mean(lambda tupleA: tupleA[1])
相关推荐
j7~3 分钟前
【Python】(篇六)《基础语法(函数、列表和元组、字典、文件)》---详解
开发语言·python·文件·函数·字典·编程学习·元组与列表
Geeys7 分钟前
拼多多店铺怎么运营才能有订单?新手低成本出单攻略
大数据·网络·人工智能
艾莉丝努力练剑11 分钟前
【AI大模型接入SDK】ChatSDK架构设计与实现
网络·c++·人工智能·学习·语言模型
Wx-bishekaifayuan30 分钟前
springboot户外登山社交小程序19787-计算机课程设计、毕业设计
spring boot·后端·python·spring·elasticsearch·django·课程设计
FYKJ_201040 分钟前
springboot刑事案件管理系统03047-计算机课程设计、毕业设计
vue.js·spring boot·python·mysql·typescript·spark·django
BYSJMG1 小时前
计算机毕业设计选题推荐:基于大数据的快递物流运营数据分析与可视化,Spark与K-Means
大数据·算法·数据分析·spark·课程设计
盟接之桥1 小时前
线束数字化--先进先出为什么总是停留在纸面上?
大数据·网络·数据库·人工智能·制造·ai编程
隔振降噪研究员2 小时前
破碎机振动治理科普
大数据·人工智能
Python图像识别2 小时前
18-【2027毕设】YOLO11烟雾检测识别系统 - Python完整源码+PyQt5界面+训练模型+数据集
python·深度学习·yolo·毕业设计·毕设
FYKJ_20102 小时前
springboot助农产品销售商城05829-计算机课程设计、毕业设计
java·spring boot·python·mysql·spark·django