Apache SeaTunnel 自定义连接器适配华为大数据平台集成组件ClickHouse

技术背景

Apache SeaTunnel 作为一款开源的数据集成框架,支持多种数源的集成。根据我司的业务场景,需要将每日的流水数据从MySQL按日期归档到ClickHouse中。

用户可以通过ClickHouse实现在线分析处理查询(OLAP)和分析数据报告生成。通过Apache SeaTunnel实现每日增量流水数据从MySQL归档到ClickHouse

由于使用华为增强的ClickHouse版本,目前开源中的ClickHouse连接器无法直接使用,且需要经过Kerberos认证。

同时华为增强的ClickHouse版本是基于ELB(Elastic Load Balance)的HA部署架构,需要通过Https协议访问高可用的ELB节点。

支持华为增强的ClickHouse版本

基于通用性的考虑,采用增强Connector-JDBC的方式,使该连接器兼容华为增强的ClickHouse版本的JDBC连接方式。

目前Connector-JDBC模块支持了多种SQL方言,如MySQL,GBASE,DB2等。

Connector-JDBC模块使用自动服务加载器(ServiceLoader)实现方言组件的自动加载(目前大部分开源组件都会使用类似机制以提高程序的可扩展性)。

在Connector-JDBC模块增加对华为增强的ClickHouse版本支持分为如下步骤:

增加ClickHouse方言配置

1)ClickhouseDialect:定义方言名称等信息

2)ClickhouseFactory: ClickHouse方言定义工厂。

Source或者Sink组件启动时会根据URL开头匹配到实际的方言工厂类,并进行加载。

3)ClickHouseJdbcRowConverter:行转换器

4)ClickHouseTypeMapper:类型转换器

由于Apache SeaTunnel自定义了通用数据类型SeaTunnelRow,所有其他的数据类型都需要转化成SeaTunnel自身的数据类型。

例如: 将ClickHouse中的UINT16对应到LONG类型:

跟踪源码,Source在初始化时会进行转化操作。

新增华为ClickHouse的JDBC连接工具类。

该类参考华为官方给的ClickHouse示例代码。

扩展SimpleJdbcConnectionProvider,以支持ClickHouse的JDBC连接。

测试连接器

配置SeaTunnel脚本:使用Example模块进行单元测试

其中Source配置的是MYSQL的数据源

Sink配置ClickHouse的数据源

  • driver:clickhouse

  • url:jdbc:ch//IP:PORT,IP是ELB的IP,PORT是HTTPS的端口

  • user: kerberos认证用户

  • password: kerberos认证用户密码

运行成功,查看结果:

本文由 白鲸开源科技 提供发布支持!

相关推荐
科技测评-阿博7 分钟前
国际物流怎么找客户?一套可复用的ToB获客筛选思路
大数据
老赵聊算法、大模型备案13 分钟前
“清朗·整治AI应用乱象”专项行动深度解读:从资质合规视角看AI应用新规
大数据·人工智能·算法·安全·aigc
rainbow72424413 分钟前
深度解析:如何建立适合自己团队的AI能力评估矩阵?
大数据·人工智能
m0_3801671419 分钟前
如何用订单簿数据判断真假突破(OrderBook 实战)
大数据·人工智能·区块链
2601_9571909021 分钟前
科技驱动文旅变革:超元力剧场的技术哲学与商业价值
大数据·人工智能·科技
byoass24 分钟前
企业云盘全文检索技术选型:Elasticsearch、MeiliSearch、Typesense实战对比
大数据·网络·安全·elasticsearch·云计算·全文检索
财迅通Ai32 分钟前
晨光新材:产能释放驱动增长 全产业链优势稳固向好
大数据·人工智能·晨光新材
BizViewStudio36 分钟前
小程序泛在化时代:2026 年跨平台开发技术选型指南
大数据·网络·人工智能·小程序·媒体
@insist12310 小时前
信息安全工程师考点精讲:身份认证核心原理与分类体系(上篇)
大数据·网络·分类·信息安全工程师·软件水平考试
天辛大师10 小时前
AI助力旅游扩大化,五一旅游公园通游年票普惠研究
大数据·启发式算法·旅游