一文详解pyspark常用算子与API

rdd.glom()

对rdd的数据进行嵌套,嵌套按照分区来进行

cpp 复制代码
    rdd = sc.parallelize([1, 2, 3, 4, 5, 6, 7, 8, 9], 2)
    print(rdd.glom().collect())

输出:\[1,2,3,4,5,6,7,8,9]

参考

相关推荐
starzy199013 分钟前
Spark 核心之自定义累加器以及版本对比变化深度剖析
大数据·ajax·spark
用户3610588626125 小时前
Spark 核心之 Spark-SortShufflebypass 原理深度剖析
大数据·spark
starzy19907 小时前
Spark 核心之二次排序、分组取 TopN 优化分析
大数据·分布式·spark
乌恩大侠1 天前
图解 AI-RAN开发需要哪些软硬件:O-RU、DGX Spark、Sionna与Aerial
人工智能·spark·o-ru·ai-ran
阿里云大数据AI技术2 天前
阿里云 EMR Daft AI Function:用 DataFrame 表达式搞定大模型调用与多模态向量化
人工智能·spark
BD_Marathon2 天前
部署Spark
大数据·javascript·spark
Blossom i2 天前
Python+spark2.0+Hadoop机器学习与大数据实战第十一章:Python Spark的集成开发环境
大数据·hadoop·spark
BD_Marathon2 天前
开发Spark应用程序
大数据·ajax·spark
用户3610588626123 天前
Spark 核心之广播变量、累加器原理深度剖析
大数据·spark
用户3610588626124 天前
Spark 核心之二次排序、分组取 TopN 优化分析
大数据·spark