import org.apache.spark.{Partitioner, SparkConf, SparkContext}
object PartitionCustom {
// 分区器决定哪一个元素进入某一个分区
// 目标: 把10个分区器,偶数分在第一个分区,奇数分在第二个分区
// 自定义分区器
// 1. 创建一个类继承Partitioner
// 2. 重写两个方法
// 3. 在创建RDD的时候,partitionBy方法 指定分区器
// 创建一个类继承Partitioner
class MyPartitioner extends Partitioner{
override def numPartitions: Int = 2 // 两个分区,编号就是:0,1
// key - value
override def getPartition(key: Any): Int = {
if(key.asInstanceOf[Int] % 2 == 0){
0
}else{
1
}
}
}
def main(args: Array[String]): Unit = {
// 创建SparkContext
val conf = new SparkConf().setAppName("PartitionCustom").setMaster("local[*]")
val sc = new SparkContext(conf)
// 初始数据
val rdd = sc.parallelize(List(1, 2, 3, 4, 5, 6, 7, 8, 9, 10))
//val rdd = sc.parallelize(List( (1,1), (2,2))
// 自定义分区器使用的前提:数据是key-value类型
val rdd1 = rdd.map(num =>(num,num))
// 使用自定义分区器
val rdd2 = rdd1.partitionBy(new MyPartitioner)
// 在分区完成之后的基础上,只保留key
val rdd3 = rdd2.map(t => t._1)
rdd3.saveAsTextFile("output6")
}
}
spark小任务
只因只因爆2025-05-15 18:20
相关推荐
南讯股份Nascent21 分钟前
洽洽全域会员项目启动会圆满召开大郭鹏宇25 分钟前
基于 LangGraph 构建智能分诊系统(一):项目概述与环境搭建Database_Cool_1 小时前
单机 MySQL 迁移到分布式数据库方便吗?阿里云 PolarDB-X 100% MySQL 协议兼容零改造平滑迁移天天爱吃肉82184 小时前
【电源拆解:跟着问答逐一认识开关适配器PCB元器件】Elastic 中国社区官方博客4 小时前
将你的 Grafana Kubernetes 仪表板迁移到 Elastic Observability:相同的 PromQL,30 倍更快的查询abcy0712134 小时前
storm核心实时机制灵机一物5 小时前
合伙制律所分红和提成律师个税怎么合规优化?REST_30277 小时前
告别Excel孤岛:一款任务链路可视化工具带来的真实改变Elastic 中国社区官方博客8 小时前
如何使用 OpenTelemetry 对你的搜索 API 进行埋点,并使用 ES|QL 对其进行查询Xzaveir_7779 小时前
OPPO、vivo、荣耀号码认证:多终端拨测矩阵与异常复现