技术聚焦:Debezium 如何将数据库数据精准注入 Kafka

#作者:任少近

文章目录

  • [第一章 Debezium抽取mysql数据给kafka原理](#第一章 Debezium抽取mysql数据给kafka原理)
  • [第二章 Debezium 与kafka抽取方法及验证](#第二章 Debezium 与kafka抽取方法及验证)
    • [2.1 debezium2.0+kafka3.3.1+mysql8](#2.1 debezium2.0+kafka3.3.1+mysql8)
    • [2.2 debezium2.0+kafka2.6.1+mysql8](#2.2 debezium2.0+kafka2.6.1+mysql8)
    • [2.3 debezium2.0+kafka2.6.1+mysql5.7](#2.3 debezium2.0+kafka2.6.1+mysql5.7)

第一章 Debezium抽取mysql数据给kafka原理

debezium的connector捕获到源数据库数据更新,发送到kafka集群中,利用kafka connect提供的sink connector,将数据同步到其他数据库,数据仓库等存储介质中。

上图中是采集mysql的binlog日志。真正主要的是SnapshotReader和BinlogReader,实现了对MySQL数据的全量读取和增量读取,采集到的数据默认一个表一个kafka topic,也可以指定topic名。将数据同步到其他系统、数据库、数据仓库等。

第二章 Debezium 与kafka抽取方法及验证

准备基于服务:

使用Debezium需要三个独立的服务:ZooKeeper、Kafka和Debezium connector服务

为了验证适配置版本问题,需要部署环境、安装部署:

复制代码
docker run -it --rm --name zookeeper -p 2181:2181 -p 2888:2888 -p 3888:3888 -d quay.io/debezium/zookeeper:2.0
docker run -it --rm --name kafka -p 9092:9092 --link zookeeper:zookeeper -d quay.io/debezium/kafka:2.0
docker run -it --rm --name mysql -p 3306:3306 -e MYSQL_ROOT_PASSWORD=debezium -e MYSQL_USER=mysqluser -e MYSQL_PASSWORD=mysqlpw -d quay.io/debezium/example-mysql:2.0
docker run -it --rm --name connect -p 8083:8083 -e GROUP_ID=1 -e CONFIG_STORAGE_TOPIC=my_connect_configs -e OFFSET_STORAGE_TOPIC=my_connect_offsets -e STATUS_STORAGE_TOPIC=my_connect_statuses --link kafka:kafka --link mysql:mysql -d quay.io/debezium/connect:2.0

情况如下:

2.1 debezium2.0+kafka3.3.1+mysql8

  • 官网最新稳定版debezium的为2.0版本
  • Mysql为Mysql 8.0.31版本
  • Kafka为3.3.1版本,scala为2.13版本
  • Zookeeper为3.6.3版本

验证如下:

配置文件说明:

复制代码
 { 
"name": "inventory-connector", 
"config": { 
//官方提供的类,已经写死,直接可以用
"connector.class": "io.debezium.connector.mysql.MySqlConnector", 

 "tasks.max": "1", 

"database.hostname": "mysql",
 "database.port": "3306", 
"database.user": "debezium", 
"database.password": "dbz", 
//这个连接器作为mysql一个slave来工作,ID可以随便写。
"database.server.id": "184054",
//作为topic的前缀 ,比如一个表生成一个topic可以这么命名
"topic.prefix": "dbserver1",  
// 选择某一个数据库
"database.include.list": "inventory",
//存一些历史记录,比如kafka的地址
 "schema.history.internal.kafka.bootstrap.servers": "kafka:9092",
//主要用来存储debezium的schema来用
 "schema.history.internal.kafka.topic": "schemahistory.inventory"
  }
 }'

插入数据验证:

查看下采集的binlog

复制代码
docker run -it --rm --name watcher --link zookeeper:zookeeper --link kafka:kafka quay.io/debezium/kafka:2.0 watch-topic -a -k dbserver1.inventory.customers

2.2 debezium2.0+kafka2.6.1+mysql8

  • 官网最新稳定版debezium的为2.0版本

  • Mysql为Mysql 8.0.31版本

  • Kafka为2.6.1,scala为2.12版本

  • Zookeeper为3.6.3版本

    对数据库进行操作:

    查看下采集的binlog

    docker run -it --rm --name watcher --link zookeeper:zookeeper --link kafka:kafka quay.io/debezium/kafka:1.4 watch-topic -a -k dbserver1.inventory.customers

2.3 debezium2.0+kafka2.6.1+mysql5.7

  • 官网最新稳定版debezium的为2.0版本

  • Mysql为5.7版本

  • Kafka为2.6.1

  • Zookeeper为3.6.3版本

    对数据库进行操作:

    查看下采集的binlog

    docker run -it --rm --name watcher --link zookeeper:zookeeper --link kafka:kafka quay.io/debezium/kafka:1.4 watch-topic -a -k dbserver1.inventory.customers

相关推荐
小菜同学爱学习几秒前
第一章 初识达梦数据库:基础认知与环境准备
数据库·达梦
zhoutongsheng4 分钟前
如何解决ORA-01078参数文件错误_pfile与spfile互相创建恢复
jvm·数据库·python
m0_716255005 分钟前
批处理一道例题+答案解析+批处理知识点总结 | 批处理高频易错场景 + 正确写法对照表
数据库·oracle
2401_824222698 分钟前
HTML怎么标注字数限制提示_HTML实时字数统计占位【详解】
jvm·数据库·python
稀饭过霍23 分钟前
数据类型【TINYINT、SMALLINT、INT、BIGINT、decimal(18,2)】表示意思
数据库
俺不要写代码27 分钟前
数据库:DML
数据库·oracle
这个DBA有点耶29 分钟前
两张百万级大表JOIN跑崩了?试试这3招
数据库·代码规范
IntMainJhy35 分钟前
「Flutter三方库sqflite的鸿蒙化适配与实战指南:从入门到踩坑的本地数据库开发全记录」
数据库·flutter·华为·信息可视化·数据库开发·harmonyos
counting money1 小时前
Spring框架基础(依赖注入-全注解形式)
java·数据库·spring
计算机安禾1 小时前
【Linux从入门到精通】第33篇:数据库MySQL/MariaDB安装与基础调优
linux·数据库·mysql