Flink部署-yarn模式和K8S模式

一、yarn模式

以Yarn模式部署Flink任务时,要求Flink是有 Hadoop 支持的版本,Hadoop 环境需要保证版本在 2.2 以上,并且集群中安装有 HDFS 服务。

Flink提供了两种在yarn上运行的模式,分别为Session-Cluster和Per-Job-Cluster模式。

Session-Cluster 模式需要先启动集群,然后再提交作业,接着会向 yarn 申请一块空间后,资源永远保持不变。如果资源满了,下一个作业就无法提交,只能等到 yarn 中的其中一个作业执行完成后,释放了资源,下个作业才会正常提交。所有作业共享 Dispatcher 和 ResourceManager;共享资源;适合规模小执行时间短的作业。

在 yarn 中初始化一个 flink 集群,开辟指定的资源,以后提交任务都向这里提交。这个 flink 集群会常驻在 yarn 集群中,除非手工停止。

一个 Job 会对应一个集群,每提交一个作业会根据自身的情况,都会单独向 yarn 申请资源,直到作业执行完成,一个作业的失败与否并不会影响下一个作业的正常提交和运行。独享 Dispatcher 和 ResourceManager,按需接受资源申请;适合规模大长时间运行的作业。

每次提交都会创建一个新的 flink 集群,任务之间互相独立,互不影响,方便管理。任务执行完成之后创建的集群也会消失。

具体启动:

(1)Session-cluster模式: 规模小,执行时间短的作业

  1. 启动hadoop集群(略)
  2. 启动yarn-session
bash 复制代码
./yarn-session.sh -n 2 -s 2 -jm 1024 -tm test -d
  1. 执行任务
bash 复制代码
./flink run -c com.atguigu.wc.StreamWordCount FlinkTutorial-1.0-SNAPSHOT-jar-with-dependencies.jar --host lcoalhost --port 7777
  1. 去yarn控制台查看任务状态

5.取消yarn-session

bash 复制代码
yarn application --kill applicaton_1556905371562_0002

(2)Per-job-cluster 模式: 规模大长时间运行的作业

  1. 启动hadoop集群(略)
  2. 不启动yarn-session,直接执行
bash 复制代码
./flink run --m yarn-cluster -c com.atguigu.wc.StreamWordCount FlinkTutorial-1.0-SNAPSHOT-jar-with-dependencies.jar --host lcoalhost --port 7777

二、Kubernetes部署

容器化部署是目前业界很流行的一项技术,基于 Docker 镜像运行能够让用户更加方便地应用进行管理和运维。容器管理工具中最为流行的就是 Kubernetes(k8s) ,而 Flink 也在最近的版本中支持了 k8s 部署模式。

1、搭建 Kubernetes 集群(lue)

2、配置各组件的 yaml 文件

在 k8s 上构建 Flink Session Cluster ,需要将 Flink 集群的组件对应的 docker 镜像分别在 k8s 上启动,包括 JobManager 、TaskManager 、JobManagerService 三个镜像服务。每个镜像服务都可以从中央镜像仓库中获取。

3、启动 Flink Session Cluster

bash 复制代码
// 启动 jobmanager-service 服务
kubectl create -f jobmanager-service.yaml
// 启动 jobmanager-deployment 服务
kubectl create -f jobmanager-deployment.yaml
// 启动 taskmanager-deployment 服务
kubectl create -f taskmanager-deployment.yaml

4、访问 Flink UI 页面

集群启动后,就可以通过 JobManagerServicers 中配置的 WebUI 端口,用浏览器输入以下 url 来访问 Flink UI 页面:
http://{JobManagerHost:Port}/api/v1/namespaces/default/services/flink-jobmanager:ui/proxy

相关推荐
Lx3526 分钟前
Flink SQL在实时数仓中的应用
大数据
玥轩_52127 分钟前
Git命令速查手册
大数据·git·elasticsearch·gitee·github·命令速查
口_天_光健39 分钟前
制造企业的数据目录编写
大数据·数据库·数据仓库·数据分析
A-刘晨阳1 小时前
时序数据库选型指南:从大数据视角切入,聚焦 Apache IoTDB
大数据·apache·时序数据库·iotdb
汤姆yu1 小时前
基于大数据的短视频流量数据分析与可视化
大数据·数据挖掘·数据分析
Ribou1 小时前
Elasticsearch 9.2.0 三节点集群配置
大数据·elasticsearch·搜索引擎
啊吧怪不啊吧3 小时前
SQL之表的时间类内置函数详解
大数据·服务器·数据库·sql
大象席地抽烟3 小时前
K8S中部署MinIO集群提供块存储服务
kubernetes
TDengine (老段)3 小时前
TDengine 产品组件 taosX
大数据·数据库·物联网·时序数据库·iot·tdengine·涛思数据
Hello.Reader3 小时前
Flink 流式计算的状态之道从 Table/SQL 语义到算子状态与 TTL 精准控制
sql·flink·linq