【Flink精讲】Flink状态及Checkpoint调优

RocksDB大状态调优

RocksDB 是基于 LSM Tree 实现的(类似 HBase) ,写数据都是先缓存到内存中,

所以 RocksDB 的写请求效率比较高。 RocksDB 使用内存结合磁盘的方式来存储数据,每

次获取数据时,先从内存中 blockcache 中查找,如果内存中没有再去磁盘中查询。 使用

RocksDB 时,状态大小仅受可用磁盘空间量的限制, 性能瓶颈主要在于 RocksDB 对磁盘

的读请求, 每次读写操作都必须对数据进行反序列化或者序列化。 当处理性能不够时,仅需

要横向扩展并行度即可提高整个 Job 的吞吐量。

开启增量检查点和本地恢复

1)开启增量检查点

RocksDB 是目前唯一可用于支持有状态流处理应用程序增量检查点的状态后端,可以修改参数开启增量检查点:

state.backend.incremental: true #默认 false,改为 true。

或代码中指定

new EmbeddedRocksDBStateBackend(true)

调整预定义选项

Flink 针对不同的设置为 RocksDB 提供了一些预定义的选项集合,其中包含了后续提到

的一些参数,如果调整预定义选项后还达不到预期,再去调整后面的 block、 writebuffer

等参数。

当 前 支 持 的 预 定 义 选 项 有 DEFAULT 、 SPINNING_DISK_OPTIMIZED 、

SPINNING_DISK_OPTIMIZED_HIGH_MEM 或 FLASH_SSD_OPTIMIZED。有条件上 SSD

的, 可以指定为 FLASH_SSD_OPTIMIZED

state.backend.rocksdb.predefined-options: SPINNING_DISK_OPTIMIZED_HIGH_MEM

#设置为机械硬盘+内存模式

相关推荐
实验室管理云平台2 分钟前
北京盛元广通检测管理方案:信息集成、质量控制与移动应用
大数据·数据库·科技
AgentMaster42 分钟前
零售行业智能客服系统怎么选?3 大场景落地与 4 款平台对比实践
大数据·人工智能·算法
跨境小彭1 小时前
多店铺运营实践:基于轻量 ERP 的定时自动化任务使用记录
大数据·自动化·跨境电商·temu
远航计算机1 小时前
客服记录怎么变成 AI 会引用的内容?五步清洗法
大数据·人工智能·算法·aigc
字节跳动数据平台1 小时前
把矩阵计算留在数据旁边:Xeon AMX 如何加速 LanceDB 与 AI 数据湖
大数据
玩美数据1 小时前
精选全球市场研究服务网络对比,帮助企业精准筛选并快速实现海外落地
大数据
码流子1 小时前
几万路监控怎么接:高速公路视频汇聚平台的架构设计与落地坑点
大数据·人工智能·物联网·算法·架构
会编程的李较瘦1 小时前
Spark On Yarn 集群搭建
大数据·spark
NailiConveyor1 小时前
智能物流装备市场的技术观察|输送设备应用与自动化渗透|仓储物流装备的数据分析
大数据·自动化·业界资讯
2601_960356382 小时前
2026届用户分析师校招能力栈:SQL、指标体系、BI与AI分析
大数据