spark缓存-persist

存储级别指定

persist:可以通过传入 StorageLevel 参数来指定不同的持久化级别。常见的持久化级别有:

MEMORY_ONLY:将 RDD 以 Java 对象的形式存储在 JVM 的内存中。若内存不足,部分分区将不会被缓存,需要时会重新计算。

MEMORY_AND_DISK:优先把 RDD 以 Java 对象的形式存储在 JVM 的内存中。若内存不足,会把多余的分区存储到磁盘上。

DISK_ONLY:将 RDD 的数据存储在磁盘上。

MEMORY_ONLY_SER:将 RDD 以序列化的 Java 对象形式存储在内存中,相较于 MEMORY_ONLY,序列化后占用的内存空间更小,但读取时需要进行反序列化操作,会带来一定的性能开销。

MEMORY_AND_DISK_SER:优先将 RDD 以序列化的 Java 对象形式存储在内存中,内存不足时存储到磁盘上。

cache:不能指定存储级别,它固定使用 MEMORY_ONLY 存储级别。

Scala 复制代码
​
import org.apache.spark.storage.StorageLevel
import org.apache.spark.{SparkConf, SparkContext}

object Cache {
  //Spark的缓存
  //1.cache()
  //2.persist()
    //cache()是persist()的一种特殊情况



  def main(args: Array[String]): Unit = {
    val conf = new SparkConf().setAppName("Cache").setMaster("local[*]")
    val sc = new SparkContext(conf)

    sc.setLogLevel("WARN")

    //创建一个包含大量随机数的RDD
    val rdd = sc.parallelize(1 to 1000000).map( _=> scala.util.Random.nextInt(100))

    //定义一个复杂的转换函数
    def complexTransformation(x:Int): Int = {
      var result=x
      for(i<-1 to 1000){
        result=result*2%100
      }
      result
    }
    //val rdd1=rdd.map(complexTransformation)

    //缓存rdd
    //val rdd1=rdd.map(complexTransformation).cache()

    //persist
    val rdd1=rdd.map(complexTransformation).persist(StorageLevel.DISK_ONLY)

    //第一次触发行动算子,计算并统计消耗时间
    val startTime=System.currentTimeMillis()
    val rs1=rdd1.collect()
    val endTime=System.currentTimeMillis()
    println("第一次计算消耗时间:"+(endTime - startTime)+"毫秒")

    //第二次触发行动算子,计算并统计消耗时间
    val startTime1=System.currentTimeMillis()
    val rs2=rdd1.collect()
    val endTime1=System.currentTimeMillis()
    println("第二次计算消耗时间:"+(endTime1 - startTime1)+"毫秒")

  }

}

​
相关推荐
隰有游龙5 小时前
hadoop集群启动没有datanode解决
大数据·hadoop·分布式
人工智能小豪7 小时前
2025年大模型平台落地实践研究报告|附75页PDF文件下载
大数据·人工智能·transformer·anythingllm·ollama·大模型应用
我的golang之路果然有问题7 小时前
ElasticSearch+Gin+Gorm简单示例
大数据·开发语言·后端·elasticsearch·搜索引擎·golang·gin
BillKu7 小时前
Vue3+Vite中lodash-es安装与使用指南
大数据·elasticsearch·搜索引擎
TDengine (老段)8 小时前
TDengine 集群容错与灾备
大数据·运维·数据库·oracle·时序数据库·tdengine·涛思数据
viperrrrrrrrrr78 小时前
大数据学习(128)-数据分析实例
大数据·学习·数据分析
我科绝伦(Huanhuan Zhou)9 小时前
保姆级Elasticsearch集群部署指导
大数据·elasticsearch·jenkins
小王毕业啦10 小时前
2022年 国内税务年鉴PDF电子版Excel
大数据·人工智能·数据挖掘·数据分析·数据统计·年鉴·社科数据
小伍_Five10 小时前
Spark实战能力测评模拟题精析【模拟考】
java·大数据·spark·scala·intellij-idea
不吃饭的猪10 小时前
记一次运行spark报错
大数据·分布式·spark