flink-对齐和不对齐,精准一次和至少一次

  1. 精准一次怎么保证?可以设置为以下2个
    1. 对齐
      1. 当有一个barrier比较快时,输入缓冲区阻塞,当另外一个barrier到来时,才进行备份,所以数据不会重复。
      2. 优点:不会造成数据重复
      3. 缺点:会造成数据积压,OOM
    2. 不对齐
      1. 当有一个barrier到来时,直接将barrier置到最后,然后将所有缓冲区的数据和状态进行备份,然后将kafka提交,然后将慢的barrier也置到最后,将所有缓冲区的数据和状态进行备份,然后将kafka提交。
      2. 优点:加快了ck
      3. 缺点:由于备份了大量数据,会造成IO压力大,磁盘存储压力大
  2. 至少一次怎么保证?
    1. 对齐
    2. 当有一个barrier比较快时,输入缓冲区不阻塞,直接向下游流动,而barrier会等待另外一个barrier,当此次ck备份成功后,JM注入新的barrier,然后到一半的时候,备份失败了,kafka回滚,从HDFS中恢复上次的ck,恢复kafka的offset,由于不阻塞,所以会重新从kafka中拉取到重复的数据进行计算,就造成了数据的重复,就是至少一次语义。
    3. 优点:不阻塞,不会造成数据积压,OOM
    4. 缺点,会造成数据重复
相关推荐
时空自由民.7 分钟前
repo 学习教程
大数据·学习·elasticsearch
刘一说7 分钟前
Elasticsearch HTTPS访问错误解决指南
大数据·elasticsearch·https
华略创新2 小时前
引入外部咨询顾问,提供专业指导——制造企业大型系统项目的明智之选
大数据·制造·crm·erp系统·企业管理软件
时序数据说3 小时前
物联网时序数据管理的利器:为何IoTDB备受青睐?
大数据·数据库·物联网·时序数据库·iotdb
Justin_193 小时前
Linux防火墙firewalld
大数据·linux·运维
Lx3524 小时前
Hadoop数据处理模式:批处理与流处理结合技巧
大数据·hadoop
城管不管4 小时前
搭建分片集群
大数据·数据库
刘一说4 小时前
Elasticsearch启动失败?5步修复权限问题
大数据·elasticsearch·jenkins
刘一说4 小时前
Elasticsearch安装启动常见问题全解析
大数据·elasticsearch·jenkins
一水鉴天5 小时前
整体设计 之 绪 思维导图引擎 之 引 认知系统 之8 之 序 认知元架构 之4 统筹:范畴/分类/目录/条目 之2 (豆包助手 之6)
大数据·架构·认知科学