Flink一致性实现原理

Apache Flink 的一致性原理核心位于检查点机制(Checkpointing)和两阶段提交协议(Two-Phase Commit) 它贯穿周期性保存分散式快照状态,在故障发生时将任务恢复至一致的状态,实现了从数据源到下游系统的「精确一次」(Exactly-Once)处理语义。

Flink一致性实现的关键原理

全局快照机制(Checkpointing)

  • 原理:基于 Chandy-Lamport 算法,Flink 在数据流中插入特殊的「Barrier」(屏障)来标记检查点。
  • 过程:Barrier从数据源传播到整个作业图(Job Graph)。当侵犯子收到所有输入流的Barrier后,保留当前状态(State)异步写入持久化存储(如HDFS),这就是JobManager确认。
  • 一致性保证:只有当所有攻击子都成功完成快照,该检查点才算完成。如果故障发生,系统会重置到最后一次成功的检查点,并重新处理数据后续。

端到端 Exactly-Once 一致性(两阶段提交)

  • 原理:为了保证 Flink 内部状态一致,而且输出到外部系统(如 Kafka)的结果也一致,Flink 使用了两阶段提交。
  • 步骤:
    预提交(Pre-commit):当Checkpoint Barrier到达Sink算子时,Sink启动事务将数据写入外部系统,但暂不提交。
    提交(Commit):JobManager确认所有算子Checkpoint成功后,通知Sink执行实际的提交操作。
  • 故障恢复:若在提交前出现故障,事务会自动回滚,确保数据不重复、不丢失。
    数据一致性级别
  • At-most-once:最多一次,故障时无法恢复,数据可能丢失。
  • At-least-once:至少一次,故障恢复时数据可能重复处理,但不会丢失(常规检查点)。
  • Exactly-once:精确一次,故障时恢复状态与未发生故障时完全一致。

总结来说,Flink的一致性靠Checkpoint恢复状态,靠Two-Phase Commit同步状态与外部输出。

相关推荐
俊哥大数据28 分钟前
Flink 2.3.0 从理论到实践 —— 第 2 章 Flink 运行时架构
网络·架构·flink
俊哥大数据34 分钟前
Flink 2.3.0 从理论到实践 —— 第 4 章 状态管理(State)
flink
HZZD_HZZD36 分钟前
厂区三级计量怎么选表?互感器倍率与需量管理
大数据·物联网·腾讯云
计算机毕业编程指导师40 分钟前
大数据毕设选题推荐:基于Hadoop+Spark全球碳排放减排策略分析与可视化系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习
大数据·hadoop·python·计算机·spark·毕业设计·碳排放减排
俊哥大数据44 分钟前
Flink 2.3.0 从理论到实践 —— 第 5 章 时间语义与 Watermark
flink
lisw051 小时前
大数据对大数据挖掘及其处理框架带来的挑战
大数据·人工智能·数据挖掘
派小心.1 小时前
多端数据分析平台的漏斗可以跨端搭建吗?5 步搭出跨端转化漏斗
大数据·运维·服务器·前端·数据分析
见闻小天地1 小时前
数据中心柴发出口保护怎么选?Emax 与 Tmax XT 的定位与分工
大数据·运维·人工智能·业界资讯
anxiao_m1 小时前
跨地域大文件怎么传?2026主流传输软件实测对比
大数据·数据库·文件传输
cc5725026532 小时前
2027 届秋招|大数据 / 统计类专业面物流运营,履约效率的表达框架
大数据