Apache SeaTunnel 正式发布2.3.5版本,功能增强及多个Bug修复

经过两个月的筹备,我们在2.3.4版本基础上进行了新一轮的迭代,本次更新不仅修复了多个关键问题,还引入了若干重要功能增强和性能优化。

在此,我们先提前感谢社区成员的贡献和支持,如果你想升级最新的版本,快跟我们一起来看看这次更新的亮点吧!

Release Note:github.com/apache/seat...

下载地址:seatunnel.apache.org/download/

主要新功能

支持作业事件通知功能,在此基础上支持实时CDC数据数据延迟事件通知(github.com/apache/seat... 用户可以自定义通知消息发送的目标端,这样一旦实时同步数据发延迟,用户就会收到消息。

文件类型的连接器,支持定义读取和写入时使用的字符编码,这在源端和目标端使用不同的字符编码时非常有用。

优化了Postgres CDC创建publication的逻辑,在这个优化之前,添加Postgres CDC的表时创建的publication的范围是ALL_TABLES,这会导致即使只同步少数的几张表也会创建一个针对所有表的发布,会造成PG WAL的无效增长。社区优化了publication的创建逻辑,只针对需要同步的表创建publication,这极大的减小了WAL增长的范围,提交了稳定性。

Zeta引擎支持设置任务的失败重试次数。之前Zeta引擎任务失败会自动重试3次,但有些场景下我们可能希望一但有错任务立即终止,由外部调度系统来进行重试。从2.3.5版本开始,用户可以通过在env中设置job.retry.times = 0来关闭自动重试。

关键Bugfix

Zeta引擎支持classloader cache功能,如果连接器已经加载到jvm中,Zeta引擎会缓存该classloader,下次再提交该种连接器对应的任务会使用缓存的classloader不再创建新的classloader,这种方式解决了提交大量任务时Zeta JVM metaspace内存增长的问题,解决了metaspace内存溢出的bug。

修复了SQL Transform精度丢失的问题,比如timestamp类型的字段可以保留之前的精度信息。

Bug fix

Core

  • fix 修复获取 SeaTunnel 空指针异常问题 (#6681)
  • Hotfix 解决默认表格问题 (#6352)
  • Chore 修正文件拼写错误 (#6606)
  • BugFixSpark-translation 修复映射类型转换错误 (#6552)
  • Hotfix 修复 Spark 示例问题 (#6486)
  • Hotfix 解决编译错误 (#6463)

Transformer

  • FixSQLTransform 修复 SQL 转换中的精度丢失问题 (#6553)
  • Bug 修复 SQLTransform 中的负常量错误 (#6533)

Connectors

  • FixKafka-Sink 修复 Kafka Sink端选项规则 (#6657)
  • Hotfix 修复 HTTP 源无法正确读取 'yyyy-MM-dd HH:mm:ss' 格式并优化日期时间工具 (#6601)
  • Bug 修复 OrcWriteStrategy/ParquetWriteStrategy 在 Kerberos 登录时的问题 (#6472)
  • FixDoc 修正 FTP Sink端配置中的 'username' 键为 'user' (#6627)
  • E2E 修复 Amazon DynamoDB 集成测试的不稳定问题 (#6640)
  • FixConnector-V2 当分区已存在时修正添加 Hive 分区的错误 (#6577)
  • FixConnector-V2 修正 Doris/StarRocks 创建表 SQL 解析错误 (#6580)
  • FixConnector-V2 修复 Doris Sink端在流加载未读取任何数据时不能关闭的问题 (#6570)
  • FixConnector-V2 修复连接器支持 SPI 但缺少无参构造器的问题 (#6551)
  • FixConnector-V2 修复 Doris 源选择字段丢失主键信息 (#6339)
  • FixFakeSource 修复模板随机生成不包含最新值的问题 (#6438)
  • FixConnector-V2 修复 MongoDB CDC 启动模式选项值错误 (#6338)
  • BugFixConnector-file-sftp 修复 SFTPInputStream.close 未正确触发文件流关闭的问题 (#6323) (#6329)
  • Fix 修复 Doris 流加载失败未报告错误的问题 (#6315)
  • fixconnector-rocketmq 修复当 checkpoint.interval 设置过小导致的空指针异常问题 (#6624)
  • BugfixTDengine 修复因多次调用提交作业 REST API 导致驱动丢失的问题 #6581 (#6596)
  • FixStarRocks 修复上游 catalogtable 表路径仅有表名部分时的空指针异常 (#6540)

Formats

  • Bug formats 修复内容包含文件分隔符时无法解析行的问题 (#6589)

Zeta(ST-Engine)

  • Hotfix 修复 HTTP 源无法正确读取 'yyyy-MM-dd HH:mm:ss' 格式并优化日期时间工具 (#6601)
  • FixZeta 修复因保存点检查机制引起的线程卡死问题 (#6568)
  • FixZeta 改进本地模式下的 Hazelcast 连接 (#6521)
  • FixZeta 修复在使用缓存模式时线程类加载器被设置为 null 的问题 (#6509)
  • Bug zeta 修复提交作业时的空指针异常 (#6492)
  • bugfix Zeta 修复使用 REST API 提交作业时类加载器未释放的问题
  • BUGZeta 工作名称显示错误 #6470
  • HotfixZeta 修复模式变更时的作业死锁 (#6389)

E2E

  • E2E 启用 StarRocksCDCSinkIT (#6626)

Improve

  • DocImprove 增加 seatunnel-engine 中文支持 (#6656)
  • DocImprove 为 start-v2/locally/quick-start-flink.md 和 start-v2/locally/quick-start-spark.md 增加中文支持 (#6412)
  • Improve 为 IDEA 添加图标 (#6394)
  • Improve 为 ReadonlyConfig::toConfig 添加过时注释 (#6353)
  • ImproveRestAPI 调用 getJobInfoById API 时始终返回 jobId (#6422)
  • ImproveRestAPI 当作业完成时返回已完成的作业信息 (#6576)
  • Improve 提升 MultiTableSinkWriter 准备提交性能 (#6495)
  • Improve 增加保存模式的处理细节日志 (#6375)
  • ImproveAPI 统一数据和类型系统 API (#5872)
  • Improve 优化使用 Parquet 读取时的类型转换错误 (#6683)
  • ImproveConnector-V2 支持 Redis 的多表汇出功能 (#6314)
  • ImproveConnector-V2 优化 Oracle CDC 端到端测试 (#6232)
  • ImproveConnector-V2 支持 HTTP Sink端的多表功能 (#6316)
  • ImproveConnector-V2 支持 INFINI Easysearch (#5933)
  • ImproveConnector-V2 支持 Hadoop HA 和 Kerberos 的 Paimon Sink端 (#6585)
  • ImproveCDC-Connector 修复 CDC 选项规则 (#6454)
  • ImproveCDC 优化快照分割读取时的内存分配 (#6281)
  • ImproveConnector-V2 在 StarRocks 上支持 TableSourceFactory (#6498)
  • ImproveJdbc 使用 varchar2 数据类型在 Oracle 中存储字符串 (#6392)
  • Improve StarRocksSourceReader 使用现有客户端 (#6480)
  • ImproveJDBC 优化获取 JDBC 字段类型的代码风格 (#6583)
  • ImproveConnector-V2 增加 ElasticSearch 类型转换器 (#6546)
  • ImproveConnector-V2 支持使用架构配置读取 ORC 并进行类型转换 (#6531)
  • ImproveJdbc 支持大门数据库的自定义大小写敏感配置 (#6510)
  • ImproveJdbc 自动创建表时增加类型转换器 (#6617)
  • ImproveCDC 优化增量阶段的分割状态内存分配 (#6554)
  • ImproveCDC 优化记录中不包含架构字段时的读取性能 (#6571)
  • ImproveJdbc 为 SQL 添加引用标识符 (#6669)
  • Improve 在 SelectDB 云Sink端禁用 2PC (#6266)
  • DocImprove 为 Kafka 连接器增加 Kerberos 认证支持 #6653

CI

  • CI 修复 CI 配置文件中仓库名称的错误 (#4795)

Zeta(ST-Engine)

  • ImproveZeta 增加类加载器缓存模式以修复元空间泄漏 (#6355)
  • ImproveTest 修复 ResourceManager 和 EventReport 模块测试不稳定的问题 (#6620)
  • ImproveTest 代码合并到开发分支时运行所有测试 (#6609)
  • ImproveTest 使类加载器缓存测试更稳定 (#6597)
  • ImproveZetastorage 更新 HDFS 配置,支持更多参数 (#6547)
  • ImproveZeta 优化 RestHttpGetCommandProcessor#getSeaTunnelServer() 的逻辑 (#6666)

Transformer

  • ImproveTransform Sql transform 支持内部结构查询 (#6484)
  • ImproveTransform 解析转换过程中移除后备操作 (#6644)
  • ImproveTransform 移除找不到字段的异常 (#6691)

Feature

  • FeatureTool 增加连接器检查脚本,解决问题 #6199 (#6635)
  • FeatureCore 支持在 CDC 源监听消息延迟事件 (#6634)
  • FeatureCore 支持作业事件监听 (#6419)
  • Featureconnector-v2 添加 XuguDB 连接器 (#6561)
  • FeatureConnector-V2 支持 Paimon 的多表汇出功能 #5652 (#6449)
  • FeatureConnectors-V2File 支持为文件源/Sink端指定编码 (#6489)
  • FeatureConnector 更新 PgSQL-CDC 发布以添加表 (#6309)
  • FeaturePaimon 支持指定 Paimon 表写入属性、分区键和主键 (#6535)
  • FeatureFeature 支持 Doris DateTimeV2 类型的 (#6358)
  • FeatureFeature 支持 SelectDB DateTimeV2 类型的 (#6332)
  • FeatureFeature 支持 Iceberg Sink连接器 #6198 (#6265)

Zeta(ST-Engine)

  • Zeta 支持在作业配置中设置作业重试次数 (#6690)

Docs

  • Docs 修复 kafka 格式的拼写错误 (#6633)
  • FixDoc 修正一些文档中的链接 (#6673)
  • FixDoc 修正一些拼写错误 (#6628)
  • FixDoc 修正 StarRocks Sink端文档中的排版错误 (#6579)
  • HotfixDocChinese 修复关于配置日志相关参数的无效链接 (#6442)
  • FixDoc 修正 Seatunnel Engine/checkpoint-storage.md 文档错误 (#6369)

贡献者名单

感谢所有为2.3.5版本做出贡献的社区成员,包括代码贡献者、文档撰写者和测试人员。Apache SeaTunnel的成功离不开每一个人的努力!

Jetiaime LeonYoah TyrantLucifer
ponxu EricJoy2048 sunxiaojian
xiaochen-zhou CosmosNi lightzhao
baicie Hisoka-X gitfortian
hailin0 ruanwenjun shangeyao
corgy-w liunaijie dailai
taohaozhi1129 LeonYoah nianhua99
xxzuo YalikWang

本文由 白鲸开源科技 提供发布支持!

相关推荐
阿里云大数据AI技术16 小时前
StarRocks x Fluss x Paimon湖流一体方案:构建秒级响应、湖流一体的实时数据引擎
大数据·人工智能
Databend16 小时前
Agent 轨迹分析与归因的数据工程实践
大数据·数据库·agent
喵个咪17 小时前
Go Wind UBA 拆解系列 - 架构总览:三服务、数据流与契约优先
大数据·后端·go
喵个咪17 小时前
Go Wind UBA 拆解系列 - 多租户与安全:两套隔离机制的边界
大数据·后端·go
喵个咪17 小时前
Go Wind UBA 拆解系列 - OLAP 与 SQL 硬核:25 个分析模型怎么落地
大数据·后端·go
喵个咪17 小时前
Go Wind UBA 拆解系列 - SDK 与采集层:从浏览器到 Kafka
大数据·后端·go
QCC产品中心1 天前
MiniMax Agent 接入实测:企业查询、股权穿透与 UBO 识别(附 Prompt 模板)
大数据·mcp·金融/非金融
SelectDB2 天前
Apache Doris Python UDF:让 SQL 直接调用 Python 生态,支撑 Agent 时代复杂业务逻辑
大数据·数据库·python
ApacheSeaTunnel2 天前
当多表数据涌入,Apache SeaTunnel 如何巧妙化解主键冲突?
大数据·开源·数据集成·seatunnel·技术分享·数据同步
大大大大晴天5 天前
Hudi Metadata Table 与 Hive Sync (HMS)怎么选?
大数据