Spark内核

环境准备及提交流程

底层通信协议

  1. Akka通信协议,收发邮箱是一体的
  2. Netty通信协议,收发邮箱是分开的

任务调度

任务的最小单位是线程。失败重试,会记录失败的次数,如果超过最大重试次数,宣告Application失败。失败的同时会记录它上一次所在的ExecutorID和Host, 最多重试4次。

Shuffle

功能:打散重分区

特点:无论MR和Spark,Shuffle都需要落盘。其中的区别是MR每次都落盘,Spark是尽可能少落盘。

落盘的话就需要考虑不同分区之间的数据如何存放的问题。假设每个Executor有两个Task,总共有三个分区。以下是四种shuffle落盘的策略:

  1. 每个Task里面的数据打散成3个文件,一个Executor生成6个文件
  2. Executor里面的两个Task的数据打散到3个文件中,一个分区一个文件,共3个文件。
  3. sortShuffle: Executor里面打散的数据落盘到一个文件中,三个分区的数据通过索引来区分。这个就是SortShuffle,目前MR就是sortShuffle。
  4. bypassShuffle:对不同分区的数据进行打散重分区时不对数据进行排序,只适合非聚合类的shuffle算子,比如reduceByKey。

Spark内存管理

堆内和堆外内存

  1. 堆内:通过JVM申请的内存,通过了JVM的转化,更加安全,并且有垃圾回收机制。
  2. 堆外:也称页缓存,自己向操作系统申请。没有经过JVM转换,不安全,没有垃圾回收机制。堆外的内存空间是通过C语言控制的,有出现内存泄漏的危险。
    • 优点:
      • 减少了垃圾回收的工作
      • 加快了复制的速度,省略了序列化的操作。
    • 缺点:
      • 堆外内存难以控制,如果内存泄漏,很难排查
      • 不适合存储复杂对象。
  3. spark中,堆外内存默认是关闭的。
  4. 配置方法
    • executor-memory 和 driver-memory
    • 启用堆外内存spark.memory.offHeap.eabled,并由spark.memory.offHeap.size设置堆外空间大小。

内存的分配

  1. 静态内存管理,简称写死
    • 分为三个部分:
      • 存储空间60%
      • 执行空间20%
      • 其他空间20%
  2. 统一内存管理,简称动态分配
    • 分为三个部分
      • 其他空间40%
      • 存储空间+计算空间=60%
    • 存储和计算空间反向使用,允许空间借用。

RDD的持久化机制

存储内存淘汰规则:

  • 旧RDD所属RDD不能处于被读状态,避免引发一致性问题
  • 新旧Block不能属于同一个RDD,避免循环淘汰
  • 按照最近最少LRU进行淘汰
相关推荐
科研前沿3 小时前
镜像视界 CameraGraph™+多智能体:构建自感知自决策的全域空间认知网络技术方案
大数据·运维·人工智能·数码相机·计算机视觉
发哥来了3 小时前
AI视频生成模型选型指南:五大核心维度对比评测
大数据·人工智能·机器学习·ai·aigc
发哥来了3 小时前
AI驱动生产线的实际落地:一个东莞厂商的技术选型实录
大数据·人工智能·机器学习·ai·aigc
历程里程碑4 小时前
4 Git远程协作:从零开始,玩转仓库关联与代码同步(带实操代码讲解)
大数据·c++·git·elasticsearch·搜索引擎·gitee·github
AI周红伟5 小时前
周红伟:运营商一季度净利集体下滑 Token运营提速
大数据·网络·人工智能
无忧智库5 小时前
研发管理的下一个十年:当多Agent协同遇上知识图谱,传统项目管理体系正在被颠覆(WORD)
大数据·人工智能·知识图谱
汽车仪器仪表相关领域7 小时前
Kvaser Memorator Professional 5xHS CB:五通道CAN FD裸板记录仪,赋能多总线系统集成测试的旗舰级核心装备
大数据·网络·人工智能·单元测试·汽车·集成测试
gQ85v10Db8 小时前
Redis分布式锁进阶第十七篇:微服务分布式锁全局治理 + 跨团队统一规范落地 + 全链路稳定性提升方案
redis·分布式·微服务
头条快讯8 小时前
中国非遗美食文化的跨国传承:鲁味居在北美市场的标准化实践与布局
大数据·人工智能
我是发哥哈10 小时前
深度评测:五款主流AI培训平台的课程交付能力对比
大数据·人工智能·学习·机器学习·ai·chatgpt