Spark累加器LongAccumulator

1.Accumulator是由Driver端总体进行维护的,读取当前值也是在Driver端,各个Task在其所在的Executor上也维护了Accumulator变量,但只是局部性累加操作,运行完成后会到Driver端去合并累加结果。Accumulator有两个性质:

1、只会累加,合并即累加;

2、不改变Spark作业懒执行的特点,即没有action操作触发job的情况下累加器的值有可能是初始值。

Scala 复制代码
object AccumulatorTest {

  def main(args: Array[String]): Unit = {
    val conf: SparkConf = new SparkConf().setAppName("test003").setMaster("local")
    val sc = new SparkContext(conf)
    sc.setLogLevel("ERROR")

    println("***********************************")
    // 使用scala集合完成累加
    var count1:Int = 0;
    var data = Seq(1,2,3,4)
    data.map(x=> count1 +=x)
    println("scala集合进行累加:" + count1)
    println("***********************************")

// 使用RDD累加,但是count2打印结果为0
// 使用foreach传递的是函数,driver在把变量发送到work时,work中Executor都有一份count2变量副本,
// 最后执行计算时每个Executor的count2会加上自己的x,与dirver短中定义的count2没有关系,所以打印结果是0,
    var count2:Int = 0
    val dataRDD: RDD[Int] = sc.parallelize(data)
    dataRDD.foreach(x=> count2 +=x)
    println(count2)

    println("**************使用累加器*********************")
    val acc: LongAccumulator = sc.longAccumulator("accumulatorTest")
    dataRDD.foreach(x=>acc.add(x))
    println("计算元素累积和:" + acc.value)
    println("统计元素个数:" + acc.count)
    println("统计元素平均值:" + acc.avg)
    println("统计元素总和:" + acc.sum)
  }
}
相关推荐
商业模式源码开发8 小时前
实体门店低获客成本增长案例:3 人转介绍模型 + 消费返还机制落地分析
大数据·商业模式·私域流量
元拓数智10 小时前
智能分析落地卡壳?先补好「数据关系+语义治理」这层技术基建
大数据·分布式·ai·spark·数据关系·语义治理
TDengine (老段)11 小时前
TDengine Tag 设计哲学与 Schema 变更机制
大数据·数据库·物联网·时序数据库·iot·tdengine·涛思数据
sxgzzn11 小时前
新能源场站数智化转型:基于数字孪生与AI的智慧运维管理平台解析
大数据·运维·人工智能
清平乐的技术专栏13 小时前
【Flink学习】(二)Flink 本地环境搭建,运行第一个入门程序
大数据·flink
这是程序猿13 小时前
Spring Boot自动配置详解
java·大数据·前端
ws20190713 小时前
AUTO TECH China 2026广州汽车零部件展:从整机集成迈向核心部件的产业跃升
大数据·人工智能·科技·汽车
humors22113 小时前
从数据到决策:汽车使用成本的精细计算指南
大数据·程序人生
大大大大晴天13 小时前
Flink技术实践:RocksDB 状态后端技术解密
大数据·flink
1892280486114 小时前
NY382固态MT29F32T08GSLBHL8-24QM:B
大数据·服务器·人工智能·科技·缓存