Spark---RDD(双值类型转换算子)

文章目录

  • 1.RDD双值类型算子
      • [1.1 intersection](#1.1 intersection)
      • [1.2 union](#1.2 union)
      • [1.3 subtract](#1.3 subtract)
      • [1.4 zip](#1.4 zip)

1.RDD双值类型算子

RDD双Value算子就是对两个RDD进行操作或行动,生成一个新的RDD。

1.1 intersection

对源 RDD 和参数 RDD 求交集后返回一个新的 RDD

函数定义:

def intersection(other: RDDT): RDDT

复制代码
    //建立与Spark框架的连接
    val rdd = new SparkConf().setMaster("local[*]").setAppName("RDD") //配置文件
    val sparkRdd = new SparkContext(rdd) //读取配置文件

    val data1: RDD[Int] = sparkRdd.makeRDD(List(1, 2, 3, 4))
    val data2: RDD[Int] = sparkRdd.makeRDD(List(3, 4, 5, 6))
    val dataRdd = data1.intersection(data2)
    dataRdd.collect().foreach(println)

    sparkRdd.stop(); //关闭连接

运行结果:

1.2 union

对源 RDD 和参数 RDD 求并集后返回一个新的 RDD

函数定义:

def union(other: RDDT): RDDT

复制代码
    val data1: RDD[Int] = sparkRdd.makeRDD(List(1, 2, 3, 4))
    val data2: RDD[Int] = sparkRdd.makeRDD(List(3, 4, 5, 6))
    val dataRdd = data1.union(data2)
    dataRdd.collect().foreach(println)

1.3 subtract

以一个 RDD 元素为主,去除两个 RDD 中重复元素,将其他元素保留下来。求差集

函数定义:

def subtract(other: RDDT): RDDT

复制代码
    val data1: RDD[Int] = sparkRdd.makeRDD(List(1, 2, 3, 4))
    val data2: RDD[Int] = sparkRdd.makeRDD(List(3, 4, 5, 6))
    val dataRdd = data1.subtract(data2)
    dataRdd.collect().foreach(println)

1.4 zip

将两个 RDD 中的元素,以键值对的形式进行合并。其中,键值对中的 Key 为第 1 个 RDD中的元素,Value 为第 2 个 RDD 中的相同位置的元素。

函数定义:

def zipU: ClassTag(other: RDDU): RDD(T, U)

复制代码
    val data1: RDD[Int] = sparkRdd.makeRDD(List(1, 2, 3, 4))
    val data2: RDD[Int] = sparkRdd.makeRDD(List(5,6,7,8))
    val dataRdd = data1.zip(data2)
    dataRdd.collect().foreach(println)


注意:如果两个RDD类型不一样,则会报错

复制代码
    val data1: RDD[Int] = sparkRdd.makeRDD(List(1, 2, 3, 4))
    val data2: RDD[Int] = sparkRdd.makeRDD(List("hello", "scala", "hello", "Java"))
    val dataRdd = data1.zip(data2)
    dataRdd.collect().foreach(println)
相关推荐
ACP广源盛1392462567322 分钟前
GSV5600 国产 8K Serdes 视频延长芯片,AI 超高清可视化远距离传输方案解析
大数据·人工智能·ai·硬件架构·国产芯片
Databend26 分钟前
Databend 原生数据血缘:追溯指标来源,检查变更影响
大数据·数据库·sql
Raas10042 分钟前
AI网关支持哪些模型?MAI Gateway(魔芋企业级AI网关)功能实测与最佳实践
大数据·人工智能·gateway·mai gateway·企业级产品
liulilittle1 小时前
OpenCode 中解禁 Muse-Spark 1.3 - max 档
ai·spark·llm·agent·tools·opencode·muse
宸津-代码粉碎机1 小时前
微服务线上踩坑复盘:接口超时、负载倾斜隐形问题根治方案(生产级配置)
java·大数据·人工智能·python·spring
TechWJ1 小时前
没有公网 IP 也想远程连 PostgreSQL?从本地数据库到固定 TCP 地址完整配置
大数据·数据库·网络安全·postgresql·内网穿透
华允物联-HUAIOT1 小时前
串口路由器是什么?带串口的工业联网设备科普
服务器
菜鸟学编程o2 小时前
Linux常见指令
linux·运维·服务器
Raas1002 小时前
MAI Gateway(魔芋企业级AI网关)技术揭秘:AI网关支持DeepSeek吗?从原理到落地
大数据·人工智能·gateway·ai网关·mai gateway·魔芋·企业级产品
合米AI SOP系统2 小时前
新能源零部件|密封锁付装配工位,合米科技AI SOP视觉防错规避工艺遗漏带来的售后故障
大数据·人工智能·科技