Starlake:一款免费开源的ETL数据管道工具

Starlake 是一款免费开源的 ETL 数据管道编排工具,可以通过声明式的配置方法(YAML、SQL)简化数据处理流程。

Starlake 项目主要基于 Scala 语言开发,遵循 Apache 2.0 开源协议,代码托管在 GitHub:

https://github.com/starlake-ai/starlake

功能特性

  • 丰富的数据源:包括 Apache Spark、Databricks、Apache Kafka、Amazon Redshift、DuckDB、DuckLake、Google BigQuery、Snowflake、PostgreSQL、 MySQL、Oracle、SQL Server、JDBC、本地文件(JSON、CSV、Excel、XML、Parquet 等)。
  • 零代码数据提取:通过 YAML 配置文件实现全量或者增量数据提取和加载,包括自动化的数据质量验证,数据隐私安全控制,应用行级和列级安全,整个不需要编写任何代码。
  • 低代码数据转换:基于 SQL 和 YAML 定义转换操作,自动化表级和字段级血缘关系。也可以通过 Python 脚本实现复杂的数据转换。
  • 自动化流程编排:Starlake 可以生成任务的有向无环图(DAG),通过集成 Airflow、Dagster 等流程编排工具实现流程自动化。
  • 数据治理和质量:支持每个操作节点的模式约束、规则验证、质量检查等措施确保数据一致性与合规性。
  • 多引擎与跨引擎:Starlake 支持为不同的任务模型使用不同的存储引擎,例如使用原生数据仓库引擎执行简单的加载操作,同时使用 Spark 引擎处理 XML 文件或者加载过程中的转换操作。
  • 本地化测试集成:Starlake 提供了一个转换编译器,可以将各种 SQL 实现转换为本地 DuckDB 语法,不需要配置额外的测试环境就可以验证数据加载、数据转换等流程。
  • VS Code 插件:支持 Starlake 配置语法高亮、模式验证、SQL 代码片段、数据管道可视化等功能。

下载安装

Starlake 支持本地部署,使用 Docker 进行安装体验的命令如下:

复制代码
# 拉取最新镜像
docker pull starlakeai/starlake:latest

# 验证安装
docker run -it starlakeai/starlake:latest help

然后可以参照以下指南和教程构建数据处理管道:

https://docs.starlake.ai/category/guides--tutorials

总结

Starlake 提供了一种基于配置的低代码数据集成管道和数据治理解决方案。

相关推荐
2601_9623878216 天前
多源数据查询指南:MySQL 联邦、Python 聚合与 Presto 引擎全对比
python·mysql·数据集成·presto·联邦查询
2601_9622841716 天前
基于Apache Cassandra与Python的数据建模及ETL实践
python·nosql·etl·数据建模·apachecassandra
想吃披萨18 天前
Kettle下载地址
etl
ApacheSeaTunnel18 天前
195 次合并、13 个新连接器!Apache SeaTunnel 8 月有哪些新进展?
大数据·开源·数据集成·seatunnel·技术分享·数据同步
RestCloud19 天前
飞书多维表格落地新思路:ETL做数据导入,豆包做业务智能分析
数据仓库·飞书·etl·数据传输·api对接·豆包
鸽芷咕20 天前
金仓KES向量数据库实战:一条SQL干掉ETL,机器人不再把停产货当现货卖
数据库·sql·etl
RestCloud22 天前
从Kettle迁移到ETLCloud:作业转换、调度迁移与平滑过渡方案
etl·kettle·etlcloud·数据传输·数据同步·数据集成平台
RestCloud23 天前
不同系统集成:CRM系统与ERP、财务系统的数据双向同步
etl·crm·erp·数据集成·etlcloud·数据传输·数据同步
Patrick在香港24 天前
把 Claude 塞进 pandas 管道:7 条脏地址实测,5 条自动清洗、2 条被闸门拦下
python·pandas·etl·claude·数据清洗
SL-staff1 个月前
采购数据链打通实战:三步用JVS-BI实现跨系统ELT与嵌入式分析(附配置逻辑)
doris·数据集成·数据中台·elt·jvs-bi·采购数字化·低代码分析