spark缓存-persist

存储级别指定

persist:可以通过传入 StorageLevel 参数来指定不同的持久化级别。常见的持久化级别有:

MEMORY_ONLY:将 RDD 以 Java 对象的形式存储在 JVM 的内存中。若内存不足,部分分区将不会被缓存,需要时会重新计算。

MEMORY_AND_DISK:优先把 RDD 以 Java 对象的形式存储在 JVM 的内存中。若内存不足,会把多余的分区存储到磁盘上。

DISK_ONLY:将 RDD 的数据存储在磁盘上。

MEMORY_ONLY_SER:将 RDD 以序列化的 Java 对象形式存储在内存中,相较于 MEMORY_ONLY,序列化后占用的内存空间更小,但读取时需要进行反序列化操作,会带来一定的性能开销。

MEMORY_AND_DISK_SER:优先将 RDD 以序列化的 Java 对象形式存储在内存中,内存不足时存储到磁盘上。

cache:不能指定存储级别,它固定使用 MEMORY_ONLY 存储级别。

Scala 复制代码
​
import org.apache.spark.storage.StorageLevel
import org.apache.spark.{SparkConf, SparkContext}

object Cache {
  //Spark的缓存
  //1.cache()
  //2.persist()
    //cache()是persist()的一种特殊情况



  def main(args: Array[String]): Unit = {
    val conf = new SparkConf().setAppName("Cache").setMaster("local[*]")
    val sc = new SparkContext(conf)

    sc.setLogLevel("WARN")

    //创建一个包含大量随机数的RDD
    val rdd = sc.parallelize(1 to 1000000).map( _=> scala.util.Random.nextInt(100))

    //定义一个复杂的转换函数
    def complexTransformation(x:Int): Int = {
      var result=x
      for(i<-1 to 1000){
        result=result*2%100
      }
      result
    }
    //val rdd1=rdd.map(complexTransformation)

    //缓存rdd
    //val rdd1=rdd.map(complexTransformation).cache()

    //persist
    val rdd1=rdd.map(complexTransformation).persist(StorageLevel.DISK_ONLY)

    //第一次触发行动算子,计算并统计消耗时间
    val startTime=System.currentTimeMillis()
    val rs1=rdd1.collect()
    val endTime=System.currentTimeMillis()
    println("第一次计算消耗时间:"+(endTime - startTime)+"毫秒")

    //第二次触发行动算子,计算并统计消耗时间
    val startTime1=System.currentTimeMillis()
    val rs2=rdd1.collect()
    val endTime1=System.currentTimeMillis()
    println("第二次计算消耗时间:"+(endTime1 - startTime1)+"毫秒")

  }

}

​
相关推荐
盛世宏博智慧档案18 分钟前
POE温湿度传感器常见故障排查与优化解决原理
大数据
数据安全技术观察38 分钟前
数据动态脱敏:让脱敏策略跟着数据目录走
大数据·网络·数据库
易番番ERP2 小时前
以销定采模式下,ERP如何帮助贸易企业管住订单真实利润
大数据·低代码·微服务·云原生·成本核算·易番番erp·以销定采
2501_944676162 小时前
揭秘!WORDTIP公司靠不靠谱?小白必看
大数据·人工智能·python
微三云 - 廖会灵 (私域系统开发)2 小时前
智慧社区项目方案:消费返物业费(美家时代模式)系统设计浅析
大数据
智购科技自动售卖机厂家3 小时前
2026自动售货机OTA升级系统设计:从全量升级到差分升级的带宽优化工程实践~YH
大数据·人工智能·numpy·pyqt·fastapi
mit6.8244 小时前
保持缓存的有效性
缓存
龙虾PRO4 小时前
2026无头式电商落地指南:解决零售Line与APP通路选择、数据割裂难题
大数据·零售
2301_786756605 小时前
今日未放榜!国自然等待期,别被往年“周五经验”绑架
大数据·人工智能·科研·国自然·国家自然科学基金
资源大佬星 课it5 小时前
完结 马士兵大数据架构师
大数据