提升数据决策时效,火山引擎DataLeapCDC分库分表能力升级!

更多技术交流、求职机会,欢迎关注字节跳动数据平台微信公众号,回复【1】进入官方交流群

近日,大数据研发治理套件DataLeap数据集成更新CDC分库分表能力,可做到将多个实例的多个数据库的多个分表同步到目标端的一个表中,先离线同步,然后实时同步。适用于分库分表场景。同时,支持将 MySQL 同步到EMR-Doris、EMR-Starrocks、LAS,助力将最新的数据以最快且最低的带宽成本同步到目标库,辅助业务数据分析准确、提效

CDC(Change Data Capture)是变更数据获取的简称。可以基于增量日志,以极低的侵入性来完成增量数据捕获的工作。核心思想是,监测并捕获数据库的变动(包括数据或数据表的插入、更新以及删除等),将这些变更按发生的顺序完整记录下来,可以直接写入到消息中间件中以供其他服务进行订阅及消费,也可以直接对接其他数据源做业务或者数据分析&应用。

相比批量抽取的优势

与批量同步相比,变更数据的捕获通常具有如下三项基本优势:

  • CDC通过仅发送增量的变更,来降低通过网络传输数据的成本

  • CDC可以帮助用户根据最新的数据做出更快、更准确的决策。例如,CDC会将事务直接传输到专供分析的应用上

  • CDC最大限度地减少了对于生产环境网络流量的干扰。

实时同步解决方案目前支持以下两种方案:

  1. 实时整库方案 即支持将一个数据库下的多张schema不同的表在一个解决方案中分别同步到目标端的不同表中。先离线同步,然后实时同步。当前支持 MySQL、PostGreSQL、SQLsever同步到EMR-Doris、StarRocks、LAS
  2. 实时分库分表方案 :在整库方案基础上, 更进一步支持将schema相同的多个实例的多个数据库的多个分表同步到目标端的一个表 中。先离线同步,然后实时同步。适用于分库分表场景。当前支持 MySQL同步到 EMR-Doris、StarRocks、LAS。支持直连同步 ,也支持中间缓存到后 kafka 后再同步

灵活的中间件缓存同步模式、极大提高数据消费灵活性

缓存配置目前支持"使用缓存 "、"无需缓存,直接同步 "这两种缓存配置方式。使用Kafka缓存需要在数据来源配置时绑定对应的CDC采集数据进入的Kafka。使用缓存 :可通过使用 Kafka 缓存来采集源端数据,这种方式需要额外配置 Kafka 数据源,并且已为对应的 Kafka 实例,创建了相应的 CDC 数据订阅采集任务,将源端 MySQL 中的数据,实时采集到 Kafka 实例中。无需缓存,直接同步:通过直接采集 MySQL Binlog 日志,进行数据实时读取。

客户价值

通过快速连接云下自建/云上数据源进行数据采集同步等,帮助客户连接各类数据上云,以及云上数据流动,轻松完成数据入仓入湖,有效发挥数据的价值。借助CDC分库分表同步,支持数据端到端快速同步,数据实时性得到进一步增强,业务决策时效性提高且更准确。

点击跳转大数据研发治理套件 DataLeap了解更多

相关推荐
小羊没烦恼!16 小时前
微服务化的基石——持续集成
java·大数据·word·powerpoint·.net
一隅论数智16 小时前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
尧炎科技17 小时前
防潮抗变形,就选纯品梅花全桉多层板
大数据
Asa1213818 小时前
R语言实现多组学因子分析(MOFA)
数据分析
这个DBA有点耶18 小时前
MVCC深入:Read View、版本链与快照读——InnoDB并发控制的内核
数据库·mysql·架构
DBA_G18 小时前
从地面到云霄:GBase数据库在民航三大场景的落地实践
数据库
程序员大阳18 小时前
副队长大数据教程(5)--集群情况下虚拟机网络配置
大数据·集群·nat·网路
自由能燃气设备18 小时前
商用全预混低氮冷凝锅炉免费方案vs付费方案对比+选型避坑指南
大数据·数据库·人工智能
科创致远18 小时前
科创致远 ESOP 系统核心效能与实战价值展示
大数据·数据库·人工智能·精益工程
嘉立创FPC苗工18 小时前
FPC与机器人的双向赋能,解锁智能装备进化新势能
大数据·人工智能·制造·fpc·电路板