flink中如何把DB大表的配置数据加载到内存中对数据流进行增强处理

背景

在处理flink的数据流时,比如处理商品流时,一般我们从kafka中只拿到了商品id,此时我们需要把商品的其他配置信息比如品牌品类等也拿到,此时就需要关联上外部配置表来达到丰富数据流的目的,如果外部配置表很大,我们如何才能做到加载到内存中并完成丰富数据流的目的呢?

丰富数据流

有两种方式可以实现丰富数据流的效果,一种是把外部配置表所有数据加载到每个TaskManager的内存中,另一种是每个TaskManager只需要加载一部分外部配置表的数据,如下所示:

总结:

当外部配置表的数据量很大时,我们可以采用每个TaskManager加载一部分数据的方式来达到数据增强的效果,至于每个TaskManager加载多少,取决于算子并行度,并行度越高,每个TaskManager就可以加载越少的数据

相关推荐
PaperData5 小时前
1985-2025年全国区县专利申请与授权面板数据
数据库
snpgroupcn5 小时前
大数据量SAP迁移方案:系统越大,越不能硬搬
数据库·sap
微三云马玮均—GEO源码系统 私有化部署5 小时前
消费返物业费:消费+服务趋势的必然产物!
大数据·人工智能·物联网·区块链·生活
Flynt6 小时前
Redis Cluster主节点挂了,为什么"高可用"还全员掉线?我把三次kill的记录翻出来了
数据库·redis·分布式
笃行3506 小时前
KingbaseES 数据加密全解:从 SSL 到全密态
数据库
Ivanqhz6 小时前
激活函数在 Transformer 中的作用及各种变体简述
java·linux·数据库·人工智能·深度学习
workflower7 小时前
AI system product quality model
大数据·人工智能·机器学习·云计算·无人机
yl45307 小时前
硫酸泄露处理生产商怎么选才够专业
大数据·人工智能·python
java1234_小锋7 小时前
【技术专题】Mysql8 数据库 - Mysql8 数据类型简介
数据库·mysql
xianghongtao01168 小时前
麦肯锡2026技术趋势02_智能体AI_研究解读
大数据·人工智能