flink打包方式问题

问题描述

flink在yarn上跑的时候,经常会遇到是否打 fat jar的问题,也就是打全包问题,很多时候由于生产环境和开发环境不一样,肯定得到线上去测试,这时如果你打fat jar的话,就会很痛苦,因为它至少都有一两百M,而且由于内外网的网速限制问题,上传会很慢,基本上你上传一次要几分钟,我这里两百多兆上传一次要3分钟的样子,每次一点小小的错误,得上传好几遍,一个小时也就测试一两回就没了,真的哭死

这个时候就会想到要只上传源码包,那就是几十K,再慢的网速都是秒上传,接下来我就说下上传源码包的方式

跑源码包的方式

  • 把本地的pom文件放到flink-home目录的,lib目录里,跑一遍mvn package,把包拉下来
  • 通过上传只有依赖包的方式

首先说下第一种方式是有风险的,因为lib目录是针对全局的,如果你几个项目的包会有冲突就会有问题,这块我就踩过坑。所有还是比较推荐第二种方式,但是第二种方式在运行的时候也是坑很多,下面具体说说

通过依赖包的方式

通过依赖包的方式,跑任务的时候也有几种方式

  • 通过-C指定特定依赖包的路径
  • 通过-yt指定
  • 把依赖包放到lib目录下
    这几种方法,第一种和第二种,我弄了好久都没有成功,不是这不行就是那不行,不知道具体是什么原因,感觉还是跟flink加载jar的顺序有关系,最后还是选择把依赖包放在lib目录下的方式成功了
    这里有个小意外,我一开始是通过pom文件的方式拉jar到lib跑的,但是后面就会出现jar冲突,最后我用打依赖包的方式放在lib下,就不会有冲突,也就是说我把jar散着一个个的放在lib里就会有jar冲突,但是我打成一个总的依赖包就不会,这个很奇怪,不知道什么原因???,有大佬可以发表下看法,万分感谢
相关推荐
北京晶数信息科技2 分钟前
成品油交易即开票原创一体化解决方案汇报(二)
大数据·人工智能·物联网·产品经理·需求分析
HAYDENR1 小时前
依赖数据迁移工具做增量同步有哪些易错点?调整数据迁移工具策略怎么保证断点续传可靠?
java·大数据·数据库
中电金信1 小时前
中电金信 :一站式企业智能体柔性生产全链路解决方案
大数据·人工智能
Jlzn88881 小时前
轻量化与高可靠性的平衡之道:CCS集成母排产线关键工艺解析
大数据·网络·物联网
观远数据1 小时前
跨部门BI落地的核心:如何做好数据集权限治理消除数据孤岛
大数据·人工智能
碧口科技1 小时前
合规打底 价值锚定:博彦科技FDE模式打通金融AI境内外规模化落地路径
大数据
天行健,君子而铎1 小时前
场景化适配+合规审查+技术突破:运营商AI数据分类分级最优解决方案
大数据·安全
leisoo809710 小时前
100GBA股股票数据怎么存ClickHouseRedisMySQLJSON完整对比
大数据·linux·服务器·开发语言·python
AI产品测评官10 小时前
突破系统割裂困局:2026企业级AI招聘架构如何迈向“原生全流程”?
大数据·微服务·架构
梦梦代码精10 小时前
连锁品牌数字化:从门店扩张到用户资产运营的技术底座
大数据·人工智能·低代码·docker·开源·代码规范