spark Rdd的创建方式

spark rdd的创建方式

spark rdd(弹性分布式数据集)有多种创建方式

简单来说有三种

1.从本地集合创建

val numbers = sc.parallelize(Array(1,2,3,4))

2.从文件系统读取

val testFile = sc.textFile("hdfs://localhost:9000/user/hadoop/data.txt")

3.从现有rdd创建而来

val numbersRDD = sc.parallelize(Array(1,2,3,4,5))

val doubleNumbersRDD = numbersRDD.map(_ * 2)

总的来说 rdd这里指的是分布式数据集

所以创建 都需要来自于其他数据集合

所以其他会有 从数据库 网络源 其他数据源

广播变量或者累加器

这里的rdd指的是分布式数据集 就是数据切片,而计算逻辑,叫做rdd算子。

相关推荐
牛企老板俱乐部1 小时前
广东机器人结构验证手板产业格局:深圳珠海东莞三城分析
大数据·人工智能
Keystone_Onion1 小时前
基于5大仓群路由算法的中大件美国海外仓降本架构与数据实测分析
大数据
buligbulig1 小时前
智能电网的数据底座:电力行业大数据治理路径解析
大数据
ltqvibe2 小时前
企业AI改造的四层路径:从点上应用到企业大脑
大数据·人工智能·本体语义平台·企业ai改造·数据打通·企业大脑·企业认知基础设施
anxiao_m2 小时前
园区数字孪生怎么搭建?主流方案与服务商深度对比
大数据·运维·人工智能
stonewl25993 小时前
2026化工企业标签打印自动化方案
大数据
独隅3 小时前
VS Code Git 工作树多分支并行开发实战指南
大数据·git·elasticsearch
千维百策6663 小时前
AI 软件开发中的人与智能体:软件工程循环、人在环路中与框架工程
大数据·人工智能·软件工程
梦伢mm4 小时前
直播切片素材不足,易元 AI 可以自动拆分直播视频做带货素材吗?
大数据
何以解忧,唯有..4 小时前
Redisson分布式锁实现原理深度解析
分布式