Flink从入门到上天系列第二十三篇:Flink中增量检查点和最终检查点

一:增量快照

在 1.15 之前,只有RocksDB 支持增量快照。不同于产生一个包含所有数据的全量备份,增量快照中只包含自上一次快照完成之后被修改的记录,因此可以显著减少快照完成的耗时。

复制代码
Rocksdb状态后端启用增量checkpoint:
EmbeddedRocksDBStateBackend backend = new EmbeddedRocksDBStateBackend(true);

从 1.15 开始,不管hashmap还是rocksdb 状态后端都可以通过开启changelog实现通用的增量checkpoint。

1:执行过程

带状态的算子将状态内容写到两个地方,第一个是状态变更日志、第二个是状态表。状态变更日志是持续性的往磁盘中写,状态表不是,状态表是大概十分钟写一次。当我们状态表

状态物化:状态表定期保存,独立于检查点。状态物化完成后,状态变更日志就可以被截断到相应的点

这种方式,会出现很多很多的小文件。

2:使用方式

复制代码
<dependency>
    <groupId>org.apache.flink</groupId>
    <artifactId>flink-statebackend-changelog</artifactId>
    <version>${flink.version}</version>
    <scope>runtime</scope>
</dependency>
开启changelog:
env.enableChangelogStateBackend(true);

二:最终检查点

如果数据源是有界的,就可能出现部分Task已经处理完所有数据,变成finished状态,不继续工作。从 Flink 1.14 开始,这些finished状态的Task,也可以继续执行检查点。自 1.15 起默认启用此功能,并且可以通过功能标志禁用它:

复制代码
Configuration config = new Configuration();
config.set(ExecutionCheckpointingOptions.ENABLE_CHECKPOINTS_AFTER_TASKS_FINISH, false);
StreamExecutionEnvironment env =StreamExecutionEnvironment.getExecutionEnvironment(config);

有界数据,某个算子已经处理完毕所有数据,这个将不会再做检查点备份。后边的算子可能仍然会运行。

有这么一个设置可以关闭,但是我们生产中不会关闭。

复制代码
config.set(ExecutionCheckpointingOptions.ENABLE_CHECKPOINTS_AFTER_TASKS_FINISH, false);
相关推荐
Web3_Daisy7 小时前
Pump.fun 与 FOMO 竞争背后的 Meme 市场变局
大数据·人工智能·金融·web3·区块链
论文避坑指南9 小时前
论文写作全流程AI合规边界:从选题到投稿的“红绿灯“清单
大数据·人工智能·深度学习
V哥AI增长11 小时前
Schema.org 结构化数据与GEO技术落地:AI引擎引用机制与JSON-LD部署实证研究
大数据·运维·人工智能
嘉禾望岗50311 小时前
datagrip连接带有kerberos认证的hive
大数据·kerberos
爱吃面的猫12 小时前
大数据Kafka3.x之——Kafka3.3.0安装与使用(详细)
大数据·分布式·zookeeper
无忧智库12 小时前
别再“裸奔”等护网了!万字拆解常态化攻防运营体系:从“应试教育”到“实战免疫”的进阶实录(PPT)
大数据·架构
用户36105886261213 小时前
Spark 核心之自定义累加器以及版本对比变化深度剖析
大数据
观远数据13 小时前
当ChatBI遇上数据合规:AI+BI规模化落地的安全边界如何划定
大数据·人工智能·安全
具身智能进化论14 小时前
协作机器人产业进入规模化部署期,未来几年的增长从何而来
大数据·运维·人工智能·机器人·自动化·工厂方法模式
hzcj88814 小时前
汇正财经:储能装机回暖,估值有待提升
大数据·人工智能