一文详解pyspark常用算子与API

rdd.glom()

对rdd的数据进行嵌套,嵌套按照分区来进行

cpp 复制代码
    rdd = sc.parallelize([1, 2, 3, 4, 5, 6, 7, 8, 9], 2)
    print(rdd.glom().collect())

输出:\[1,2,3,4,5,6,7,8,9]

参考

相关推荐
用户3610588626121 天前
Spark 核心之任务调度角色划分以及资源调度角色划分详解
大数据·spark
用户3610588626122 天前
Spark 核心之 Stage 并行度划分及优化详解
spark
用户3610588626122 天前
Spark 核心之 Stage 切分划分与计算模式详解
spark
用户3610588626123 天前
Spark 核心之 RDD 窄依赖与宽依赖详解
spark
用户3610588626123 天前
Spark 核心之 Stage 和 Task 原理剖析
spark
java1234_小锋3 天前
【免费】基于Spark实时医疗健康数据监测与疾病预测系统(Java版本+可视化大屏+Kafka+SpringBoot+Vue3) 锋哥原创出品,必属精品
大数据·spark·kafka·实时医疗健康数据监测·实时疾病预测系统
腾讯云大数据3 天前
腾讯云智能数据湖计算AI DLC发布会回顾:Spark+Ray一体化,面向Agent重构数据底座
人工智能·spark·腾讯云
用户3610588626124 天前
Spark 核心之 Application 和 Job 原理剖析
spark
阿里云大数据AI技术5 天前
EMR Serverless Spark AI Function 的双维降本实践
人工智能·sql·spark