flink分区与算子链

flink分区与算子链

  • [flink 分区策略](#flink 分区策略)
  • [flink 什么情况下才会把 Operator chain 在一起形成算子链?](#flink 什么情况下才会把 Operator chain 在一起形成算子链?)
  1. GlobalPartitioner 数据会被分发到下游算子的第一个实例中进行处理
  2. RebalancePartitioner 数 据会 被循 环发 送到 下 游的 每一 个实 例中 进 行处 理。
  3. RescalePartitioner 这种分区器会根据上下游算子的并行度,循环的方式输出到下游算子的每个实例。
  4. BroadcastPartitioner 广播分区会将上游数据输出到下游算子的每个实例中 。 适 合 于大数据集和小数据集做Jion的场景。
  5. ForwardPartitioner 用于将记录输出到下游本地的算子实例。它要求上下游 算 子 并 行 度 一 样 。 简单的说 , ForwardPartitioner 用来做数据的控制台打印 。(也是chain算子的条件)
  6. KeyGroupStreamPartitioner Hash 分区器。会将数据按 Key 的 Hash 值输出到下游算子实例中。
  7. CustomPartitionerWrapper 用户自定义分区器。需要用户自己实现 Partitioner 接口,来定义自己的分区逻辑

RescalePartitioner这里有点难以理解,假设上游并行度为 2,编号为 A 和 B。下游并行度为 4,编号为 1,2,3,4。那么 A 则把数据循环发送给 1 和 2,B 则把数据循环发送给 3 和 4。假设上游并行度为 4,编号为 A,B,C,D。下游并 行度 ,编号为 1,2。那么 A 和 B 则把数据发送给 1,C 和 D 则把数据发送给 2。

  • 上下游的并行度一致
  • 下游节点的入度为 1 (也就是说下游节点没有来自其他节点的输入)
  • 上下游节点都在同一个 slot group 中
  • 两个节点间数据分区方式是 forward(参考理解数据流的分区) 否则都是all_to_all
  • 上下游节点的 chain 策略为 ALWAYS
相关推荐
大大大大晴天2 分钟前
Hudi技术内幕:Query Types全解析
大数据
SeaTunnel3 分钟前
87 个 PR 迭代复盘|Apache SeaTunnel 5 月版本重点更新解读
大数据·数据库·开源·apache·seatunnel
薛定猫AI6 分钟前
【深度解析】ChatGPT vs Claude vs Gemini:2026年AI大模型选型全景对比
大数据·网络·人工智能
HEADKON8 分钟前
Synagis帕利佐单抗给药季节为11月至次年4月,过敏体质者需备肾上腺素
flink
safium9 分钟前
停车设备 OEM 供应商选型:从硬件到运营能力的综合考量
大数据·人工智能
terry60011 分钟前
2026携号转网查询接口深度测评:技术指标、接入教程与服务商选型
大数据·人工智能·web安全·信息与通信·数据库架构
2601_9602058811 分钟前
2026年6月,中国品牌咨询行业正经历一场深刻的范式转移
大数据·人工智能·区块链
小五传输23 分钟前
宏病毒查杀效率提升80%:2026年宏病毒查杀自动化方案详解
大数据·运维·安全
段一凡-华北理工大学23 分钟前
工业领域的Hadoop架构学习~系列文章24:adoop工业应用总结与展望 - 技术路线图与最佳实践
大数据·人工智能·hadoop·分布式·学习·架构·高炉炼铁
korry2428 分钟前
flink实时计算实例(保姆级操作)
大数据·flink