【大数据学习 | kafka高级部分】kafka的优化参数整理

1. 优化参数

参数 解释
buffer.memory RecordAccumulator 缓冲区总大小,默认 32m
batch.size 默认 16k,sender线程拉取数据大小
linger.ms sender线程拉取数据等待时长
acks 确认应答 0 1 -1
max.in.flight.requests.per.connection 没有ack返回时候可以发送几次数据
retries producer失败重试次数
enable.idempotence 启幂等性,默认 true
compression.type 生产者发送的所有数据的压缩方式
auto.leader.rebalance.enable leader是否自动切换
leader.imbalance.per.broker.percentage leader均衡比10%
leader.imbalance.check.interval.seconds leader均衡检测时间五分钟
log.segment.bytes segment大小
log.index.interval.bytes 每4k生成一个索引数据,写入一次文件
log.cleanup.policy 日志删除方式
log.retention.hours 数据保存时长
enable.auto.commit 自动提交
auto.commit.interval.ms 提交间隔
auto.offset.reset 初始化消费位置
offsets.topic.num.partitions __consumer_offsets分区数量
session.timeout.ms 消费者断开超时时间
max.poll.records 消费者拉取条数
fetch.max.bytes 消费者拉取大小
partition.assignment.strategy 消费者分区分配策略

2. 数据吞吐量和数据重复问题

数据在消费的时候可能会遇见数据堆积,无法及时消费计算的问题

这个时候可以适当的调节broker的数量和partition的数量,让多个机器帮助进行处理可提高吞吐量,并且分区越多消费者就可以适当增多,让消费速度得到很大的提升

适当增加每次拉取的大小也会增加消费速度。

java 复制代码
max.poll.records  消费者拉取条数 
fetch.max.bytes  消费者拉取大小

kafka数据稳定性保证。

首先从producer出发

ack = 0 or ack = 1 会出现数据丢失问题

ack = -1 会出现数据重复问题

开始幂等性可以进行单分区去重

保证一批次数据稳定性可以开启事物

消费者部分如果是自动提交偏移量会出现重复消费问题,手动保存偏移量就不会出现这个问题

相关推荐
ACP广源盛139246256731 小时前
此芯 P1 AI BOX / AI NAS@ACP#IX8008、IX8024 应用场景与市场机会
大数据·人工智能·分布式·单片机·嵌入式硬件
企业老板ai培训7 小时前
破解中小企业AI变现难:2026年企业AI培训与陪跑行业趋势深度报告,为何从‘陪跑’到‘变现’才是关键?
大数据·人工智能
跟着珅聪学java8 小时前
MERGE INTO开发教程
sql
aax12134538 小时前
VOC 集群治理工程实操|美丽蓝天绿岛项目 RTO 工艺选型、管控方案与申报要
大数据·数据库·人工智能
海纳百川·纳海川9 小时前
数字化升级,让废品回收更简单高效
大数据·微信小程序·小程序
这个DBA有点耶9 小时前
交易型数据库是什么?OLTP核心能力与2026选型指南
数据库·数据仓库·sql·database·数据库架构·olap·dba
码农学院9 小时前
基于Spring Boot的跨境电商多语言订单管理系统架构设计
java·大数据·spring boot
l1564694811 小时前
突围!图文混合知识库难以解析,Kimi-K3 原生视觉架构深耕知识工作,DMXAPI 统一接口,缩短项目开发周期
java·大数据·开发语言
QN1幻化引擎11 小时前
两个 AI 互相“创造自己“:Dalin X × Dalin L 自创造闭环全记录
大数据·人工智能
制造数据与AI践行者老蒋12 小时前
离谱!PromptTemplate 遇上 JSON,花括号直接引发解析战争
数据库·microsoft·json