【大数据面试题】023 Spark RDD 是什么?

一步一个脚印,一天一道面试题

RDD 是什么?

首先,RDD 全称是 Resilient Distribute Dataset 弹性分布式数据集。 是整个 Spark 的基础,核心概念。是我们用Spark 时的基础数据单位。

RDD 是不可变,可分区 ,里面元素可并行计算的数据集合。

不可变 :在下面的示例代码中,rdd1 是不会变的,而我们 rdd.map 后,会得到一个新的rdd2

scala 复制代码
val rdd2 = rdd1.map(x => x + "_str")

分布式: Spark 有多个节点,往往不是单节点运行,是集群中多个节点里都有数据。

并行计算:由于是分布式的,所以可以做到每个节点都计算一部分数据,最后分别输出或汇总输出。

Spark 设立RDD 这个概念是为了让我们少去考虑数据的大数据量下的并行计算问题。简化我们需要的操作量。

我是近未来,祝你变得更强!

相关推荐
糟了好像在长脑子1 小时前
面试总被问分布式ID? 十分钟带你读懂美团 Leaf 号段模式
分布式
方方洛19 小时前
ray教程-00-前言与导读
人工智能·分布式·机器学习
方方洛19 小时前
ray教程-01-认识Ray
人工智能·分布式·机器学习
yexianglunbai1 天前
RabbitMQ 详解:从入门到实战
分布式·rabbitmq
此时不提桶,更待何时1 天前
06-16-B-Kafka面试与生产事故实战
分布式·面试·kafka
mesyinjinghan1 天前
半导体 MES 与 ERP 的接口边界:六类单据该留在哪一层
分布式·eap·半导体mes
codigger1 天前
Redis 正式接入 AI:当"最懂速度的数据库"开始解决"记忆问题"
redis·分布式·后端·ai·向量检索
樱花落木兰1 天前
Redisson 可重入分布式锁底层原理详解
分布式
计算机毕业编程指导师1 天前
大数据毕设选题推荐:基于Hadoop+Spark全球碳排放减排策略分析与可视化系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·hadoop·python·计算机·spark·毕业设计·碳排放减排
此时不提桶,更待何时2 天前
06-12-A-Kafka存储深水区与源码解析详解
分布式·kafka·linq