import org.apache.spark.{Partitioner, SparkConf, SparkContext}
object PartitionCustom {
// 分区器决定哪一个元素进入某一个分区
// 目标: 把10个分区器,偶数分在第一个分区,奇数分在第二个分区
// 自定义分区器
// 1. 创建一个类继承Partitioner
// 2. 重写两个方法
// 3. 在创建RDD的时候,partitionBy方法 指定分区器
// 创建一个类继承Partitioner
class MyPartitioner extends Partitioner{
override def numPartitions: Int = 2 // 两个分区,编号就是:0,1
// key - value
override def getPartition(key: Any): Int = {
if(key.asInstanceOf[Int] % 2 == 0){
0
}else{
1
}
}
}
def main(args: Array[String]): Unit = {
// 创建SparkContext
val conf = new SparkConf().setAppName("PartitionCustom").setMaster("local[*]")
val sc = new SparkContext(conf)
// 初始数据
val rdd = sc.parallelize(List(1, 2, 3, 4, 5, 6, 7, 8, 9, 10))
//val rdd = sc.parallelize(List( (1,1), (2,2))
// 自定义分区器使用的前提:数据是key-value类型
val rdd1 = rdd.map(num =>(num,num))
// 使用自定义分区器
val rdd2 = rdd1.partitionBy(new MyPartitioner)
// 在分区完成之后的基础上,只保留key
val rdd3 = rdd2.map(t => t._1)
rdd3.saveAsTextFile("output6")
}
}
spark小任务
只因只因爆2025-05-15 18:20
相关推荐
小羊没烦恼!5 天前
微服务化的基石——持续集成一隅论数智5 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能尧炎科技5 天前
防潮抗变形,就选纯品梅花全桉多层板程序员大阳5 天前
副队长大数据教程(5)--集群情况下虚拟机网络配置自由能燃气设备5 天前
商用全预混低氮冷凝锅炉免费方案vs付费方案对比+选型避坑指南科创致远5 天前
科创致远 ESOP 系统核心效能与实战价值展示嘉立创FPC苗工5 天前
FPC与机器人的双向赋能,解锁智能装备进化新势能AI职业加油站5 天前
AI智能体应用工程师证书:政策红利下的职业新风口龙亘川5 天前
一网统管AI平台民生业务实践:基于城市数字底座赋能公积金业务服务升级码流子5 天前
高速公路安全监测实践:碰撞监测预警+物联网底座,从感知到处置的闭环