flink cdc 原理解读

文章目录

快照阶段

1.根据主键或者非主键把数据分成chunk,每个并行,处理一个chunk,每个chunk,根据切分范围,先同步快照数据,然后要同步lw,到hw 期间的binglog数据,对快照数据进行修正。

增量阶段

1.统计所有chunk ,选择最小的lw作为增量binglog的起点。这里面有注意的一点,只有在已完成的快照分片范围内,并且偏移量高于 high watermark 的 binlog 事件才会被输出。

举例

假设有以下分片和对应的 high watermark:

分片 snapshot-split-0:[0, 1024),high watermark = HW0

分片 snapshot-split-1:[1024, 2048),high watermark = HW1

在这种情况下,增量数据的处理规则如下:

对于分片 snapshot-split-0,只有当 offset > HW0 且事件键在 [0, 1024) 时,增量事件才会输出。

对于分片 snapshot-split-1,只有当 offset > HW1 且事件键在 [1024, 2048) 时,增量事件才会输出。

总结

通过快照分片和 high watermark 机制,Flink CDC 实现了增量快照读取的精确控制。增量事件只有在已完成的快照分片范围内、并且偏移量超过 high watermark 时才会被输出,确保了增量数据与快照数据在顺序性和一致性上的无缝对接

问题
  • 为啥小于hw不输出,实际上小于hw,已经同步快照的阶段处理了
  • 如果遇到事务rallback,如何处理
bash 复制代码
BEGIN;
INSERT INTO orders (id, status) VALUES (1, 'NEW');
UPDATE orders SET status = 'SHIPPED' WHERE id = 1;
ROLLBACK;

在这段事务中,由于执行了 ROLLBACK,这两条操作不会影响数据库的最终状态。在 MySQL 的 binlog 日志中,这一事务会包括 BEGIN 和 ROLLBACK 标记,而不会有 COMMIT 标记。

在 Flink CDC 中的处理流程如下:

读取到 BEGIN 标记后,将该事务视为暂存状态,并缓存该事务的所有变更数据。

读取 INSERT 和 UPDATE 操作,并暂时存储这些变更记录,等待后续的事务提交。

读取到 ROLLBACK 标记后,丢弃当前事务的所有变更数据,并清除缓存,确保这两条未提交的变更不会输出到下游系统。

相关推荐
财经资讯数据_灵砚智能15 小时前
基于全球经济类多源新闻的NLP情感分析与数据可视化(夜间-次晨)2026年6月14日
大数据·人工智能·python·ai·信息可视化·自然语言处理·灵砚智能
Justice Young15 小时前
Flink第六章:flink中的时间和窗口
大数据·flink
xingyuzhisuan16 小时前
算力租赁平台 GPU 资源隔离方案:显存抢占问题深度排查与解决
大数据·云计算·gpu算力
天天讯通17 小时前
OKCC 呼叫中心安全性能全解析:技术防护与管理措施指南
大数据·开发语言·网络·人工智能·安全·语音识别
名不经传的养虾人18 小时前
从0到1:企业级AI项目迭代日记 Vol.47|从“能说”到“能上手”
大数据·人工智能·ai编程·企业ai·多agent协作
MicroTech202519 小时前
业绩披露|微算法科技(MLGO)2025年净利润1.27亿元
大数据·人工智能·科技
AGIPlayer19 小时前
没有生态的大模型不算前沿
大数据·人工智能·物联网
weilaieqi119 小时前
际连集团:印尼公司注册代办一站式服务
大数据
林间码客19 小时前
04 ROC曲线与AUC:从零开始手动计算
大数据·人工智能·算法
穆利堂-movno120 小时前
住宅、写字楼、高校、医院物业后勤数字化升级:“收费+巡检+工单”全链路落地思路
大数据