Spark处理过程-转换算子和行动算子(一)

RDD的处理过程


RDD经过一系列的"转换"操作,每一次转换都会产生不同的RDD,以供给下一次"转换"操作使用,直到最后一个RDD经过"行动"操作才会真正被计算处理。

  1. 延迟。RDD中所有的转换都是延迟的,它们并不会直接计算结果。相反,他们只是记住这些应用到基础数据集上的转换动作。只有当发生要求返回结果给driver的动作时,这些转换才会真正运行。
  2. 血缘关系。一个RDD运算之后,会产生新的RDD。
相关推荐
中钧科技2 分钟前
数字化的本质、核心、重点各是什么?
大数据·人工智能
TDengine (老段)18 分钟前
TDengine IDMP 事件 —— 事件模板
大数据·数据库·人工智能·时序数据库·tdengine·涛思数据
蓝天守卫者联盟131 分钟前
多段式TO炉厂家深度解析:技术选型与行业应用洞察
大数据
斯特凡今天也很帅32 分钟前
Elasticsearch数据库专栏(二)DSL语句总结(更新中)
大数据·elasticsearch·搜索引擎
杰建云16736 分钟前
多门店小程序和连锁管理系统的区别?
大数据·小程序制作
mhkxbq40 分钟前
昆仑G5580、G5680 V2、G2280及泰山鲲鹏200,AI大数据优选服务器
大数据·服务器·人工智能
Henb9291 小时前
# Spark 内核级调优源码分析
大数据·ajax·spark
q_35488851531 小时前
计算机毕业设计:Python智慧水文监测与流量预测系统 Flask框架 多元线性回归 数据分析 可视化 水网 流量预测 水位预测(建议收藏)✅
大数据·python·信息可视化·数据挖掘·flask·线性回归·课程设计
二十七剑1 小时前
Elasticsearch的索引问题
大数据·elasticsearch·搜索引擎
枫叶林FYL1 小时前
【自然语言处理 NLP】8.2 Ring Attention 与分布式长上下文训练
人工智能·分布式·自然语言处理