一文详解pyspark常用算子与API

rdd.glom()

对rdd的数据进行嵌套,嵌套按照分区来进行

cpp 复制代码
    rdd = sc.parallelize([1, 2, 3, 4, 5, 6, 7, 8, 9], 2)
    print(rdd.glom().collect())

输出:\[1,2,3,4,5,6,7,8,9]

参考

相关推荐
Code知行合壹6 小时前
数据中台设计
大数据·分布式·spark
weixin_307779137 小时前
PySpark根据输入的表名和过滤条件生成 INSERT 语句
python·spark·云计算·big data
阿里云大数据AI技术1 天前
一套 Spark SQL,打通多种 Catalog:EMR Serverless Spark 统一数据处理实践
人工智能·sql·spark
绿算技术1 天前
大模型本地化的经济账:DeepSeek V4 Flash 部署实测
人工智能·科技·算法·spark
伟大的大威2 天前
三台 DGX Spark 部署 DeepSeek V4 Flash NVFP4:从零到可用教程
大数据·分布式·spark
starzy19902 天前
SparkStreaming 之 updateStateByKey 算子详解及代码实现
大数据·spark
roman_日积跬步-终至千里2 天前
Spark 资源配置与 Shuffle 故障排查生产手册
大数据·分布式·spark
roman_日积跬步-终至千里2 天前
常驻 Spark 引擎的稳定性风险:从一次 Linkis 任务失败说起
大数据·分布式·spark
吴声子夜歌2 天前
Java面试——Spark原理及应用(二)
java·面试·spark