Flink如何基于事件时间消费分区数比算子并行度大的kafka主题

背景

使用flink消费kafka的主题的情况我们经常遇到,通常我们都是不需要感知数据源算子的并行度和kafka主题的并行度之间的关系的,但是其实在kafka的主题分区数大于数据源算子的并行度时,是有一些注意事项的,本文就来讲解下这些注意事项

flink数据源算子并行度大于kafka主题分区数

我们这里的注意事项对于即使做到配置flink数据源算子的并行度和kafka主题一样,但是有一些kafka主题没有消息发送过来的情况是一样的,这里的问题可以归结于以下两点:

1.有些kafka主题在某个时间点之后没有消息发送过来了

2.由于算子并行度大于kafka主题的分区数,有些数据源算子任务根本不会发送水位线到下一个算子任务

解决以上两个问题的方法是:

java 复制代码
WatermarkStrategy
        .<Tuple2<Long, String>>forBoundedOutOfOrderness(Duration.ofSeconds(20))
        .withIdleness(Duration.ofMinutes(1));

通过设置算子任务的水位线策略允许空闲的方式来做到,不过从源头上来说,为了尽可能均匀的处理数据,我们尽量设置数据源算子的并行度等于kafka的主题数

相关推荐
Days20502 分钟前
第二章 社会老年学的概念和理论框架
大数据·人工智能
算了吧95699 分钟前
2026年GEO服务商深度测评:答序科技“诊断型”全栈闭环的技术架构与行业价值
大数据·人工智能
拓人间精准客21 分钟前
数据即生产力:全维度销售线索如何以“多维数据优势“重塑 B2B 获客格局
大数据·人工智能·tob
用户3610588626121 小时前
SparkStreaming 之 Driver HA 原理及搭建实操
大数据·spark
2601_960017621 小时前
宠物食品行业PLM服务商一半科技,打造配方饲喂试验数字化能力
大数据·科技
JoyCong19981 小时前
从iPhone Ultra到ToDesk:折叠大屏时代的效率革命,硬件只是开始
大数据·运维·ios·智能手机·iphone·远程工作·远程操作
集成电路芯片封装设备1 小时前
功率循环测试配套真空炉的核心要点与实践经验
大数据
东师兄2 小时前
实习生没有错,错的是3500万个JSON文件
大数据
小五传输2 小时前
【一文解读】汽车制造业协同,跨网跨区域文件传输如何落地?
大数据·运维·安全
长谷深风1112 小时前
Agent 的 Context 里,到底应该放什么?
大数据·人工智能·prompt工程·ai agent·智能体·context工程·systemprompt