Flink的两阶段提交是什么

两阶段提交 Two-Phase-Commit,简称 2PC,是很常用的解决分布式事务问题的方式,它可以保证在分布式事务中,要么所有参与进程都提交事务,要么都取消,即实现 ACID 中的 A (原子性)。在数据一致性的环境下,其代表的含义是:要么所有备份数据同时更改某个数值,要么都不改,以此来达到数据的强一致性。

Flink 社区将两阶段提交协议中的公共逻辑进行了提取和封装,发布了可供用户自定义实现特定方法来达到 Flink EOS特点的 TwoPhaseCommitSinkFunction。

两阶段提交可以归纳为一目的两角色三条件

一目的:分布式系统架构下的所有节点在进行事务提交时要保持一致性(即要么全部成功,要么全部失败);

两角色

协调者(Coordinator),负责统筹并下达命令工作,起到分布式事务的协调管理作用

参与者(Participants),负责认真干活并响应协调者的命令。

三条件

分布式系统中必须存在一个协调者节点和多个参与者节点,且所有节点之间可以相互正常通信;

所有节点都采用预写日志方式,且日志可以可靠存储;

所有节点不会永久性损坏,允许可恢复性的短暂损坏。

两阶段提交,顾名思义,即分两个阶段:PreCommit 投票阶段和 Commit 提交阶段

PreCommit 阶段(投票):

协调者向所有参与者发起请求,询问是否可以执行提交操作,并开始等待所有参与者的响应;

所有参与者节点执行协调者询问发起为止的所有事务操作,并将 undo 和 redo 信息写入日志进行持久化;

所有参与者响应协调者发起的询问。对于每个参与者节点,如果他的事务操作执行成功,则返回"同意"消息;反之,返回"终止"消息。

Commit 阶段(提交):

如果协调者获取到的所有参与者节点返回的消息都为"同意"时,协调者向所有参与者节点发送"正式提交"的请求(成功情况);反之,如果任意一个参与者节点预提交阶段返回的响应消息为"终止",或者协调者询问阶段超时,导致没有收到所有的参与者节点的响应,那么,协调者向所有参与者节点发送"回滚提交"的请求(失败情况)。

成功情况所有参与者节点正式完成操作,并释放在整个事务期间占用的资源;反之,失败情况下,所有参与者节点利用之前持久化的预写日志进行事务回滚操作,并释放在整个事务期间占用的资源。

成功情况下,所有参与者节点向协调者节点发送"事务完成"消息;失败情况下,所有参与者节点向协调者节点发送"回滚完成"消息。

相关推荐
BD_Marathon5 小时前
【Flink】部署模式
java·数据库·flink
技术与健康6 小时前
LLM实践系列:利用LLM重构数据科学流程03- LLM驱动的数据探索与清洗
大数据·人工智能·重构
TDengine (老段)7 小时前
TDengine IDMP 应用场景:工业锅炉监控
大数据·数据库·物联网·信息可视化·时序数据库·tdengine
软件开发明哥8 小时前
BigData大数据应用开发学习笔记(06)实时检索--HBase
大数据
杨荧9 小时前
基于Python的农作物病虫害防治网站 Python+Django+Vue.js
大数据·前端·vue.js·爬虫·python
卖寂寞的小男孩12 小时前
spark数据缓存机制
大数据·缓存·spark
jiedaodezhuti12 小时前
Flink直接缓冲存储器异常解析与解决方案
大数据·flink
代码的余温13 小时前
Elasticsearch Master选举机制解析
大数据·elasticsearch·搜索引擎
计算机源码社13 小时前
计算机毕设选题推荐 基于Spark的家庭能源消耗智能分析与可视化系统 基于机器学习的家庭能源消耗预测与可视化系统源码
大数据·机器学习·数据分析·spark·毕业设计·课程设计·毕业设计源码
IT研究室14 小时前
大数据毕业设计选题推荐-基于大数据的北京市医保药品数据分析系统-Spark-Hadoop-Bigdata
大数据·hadoop·spark·毕业设计·源码·数据可视化