Spark + Iceberg 快速入门

Iceberg作为常用的数据湖,以下是docker环境的快速搭建

代码下载路径

这是一个 docker compose 环境,可以快速启动并运行 Spark 环境和本地 REST 目录,并使用 MinIO 作为存储后端。

注意 :如果您尚未安装 docker,您可以前往获取 Docker 页面获取安装说明。

用法

通过运行以下命令启动笔记本服务器。

复制代码
docker-compose up

笔记本服务器将可以通过http://localhost:8888访问

在笔记本服务器运行时,如果您更喜欢使用 spark-shell、spark-sql 或 pyspark,则可以使用以下任意命令。

bash 复制代码
docker exec -it spark-iceberg spark-shell
sql 复制代码
docker exec -it spark-iceberg spark-sql
bash 复制代码
docker exec -it spark-iceberg pyspark

要停止一切,只需运行docker-compose down

故障排除和维护

刷新 Docker 镜像

将预先构建好的spark镜像上传到Dockerhub,为了方便,镜像标签默认为latest

如果您有旧版本的图像,则可能需要将其删除才能升级。

bash 复制代码
docker image rm tabulario/spark-iceberg && docker-compose pull

在本地构建 Docker 映像

如果您想更改本地文件并进行测试,您可以在本地构建图像并使用它:

bash 复制代码
docker image rm tabulario/spark-iceberg && docker-compose build

Dockerfile在此 Repo 中使用

要直接使用此 repo 中的 Dockerfile(而不是拉取预构建tabulario/spark-iceberg映像),您可以使用docker-compose build

部署变更

要将更改部署到托管的 docker 映像tabulario/spark-iceberg,请运行以下命令。(需要访问 tabulario docker hub 帐户)

bash 复制代码
cd spark
docker buildx build -t tabulario/spark-iceberg --platform=linux/amd64,linux/arm64 . --push

有关开始使用 Iceberg 的更多信息,请查看官方文档中的快速入门指南。

Docker 镜像的存储库位于 dockerhub 上

相关推荐
颜酱1 分钟前
05 | 召回前置准备:根据业务数据库生成各数据库(读取配置阶段)
前端·人工智能·后端
Wang's Blog7 分钟前
Go-Zero项目开发24: 基于Bitmap实现群聊消息已读未读
开发语言·后端·golang
Conan在掘金1 小时前
鸿蒙报错速查:struct 里嵌 namespace 声明就炸,根因 + 真解法
后端
东方小月1 小时前
从零开发一个 Coding Agent(三):EventStream 事件流通道设计与实现
前端·人工智能·后端
卫子miao1 小时前
如何评价当前大语言模型的记忆机制?
后端·架构
神奇小汤圆2 小时前
为什么 AQS 成为 Java 并发的基石?
后端
星栈2 小时前
MCP 从 stdio 迁到 SSE,踩了 5 个传输层坑
人工智能·后端·架构
Conan在掘金3 小时前
鸿蒙报错速查:struct 里嵌 enum 声明就炸,根因 + 真解法
后端
回家路上绕了弯3 小时前
Java双数据源实战全指南:Spring Boot多数据源配置、原理与踩坑避坑
后端
神奇小汤圆3 小时前
Redis主从切换后,旧主恢复竟触发全量同步?——我猜错了,原因比想象中更严谨
后端