1-【源码剖析】kafka核心概念

从今天开始开始在csdn上记录学习的笔记,主要包括以下几个方面:

  • kafka
  • flink
  • doris

本系列笔记主要记录Kafka学习相关的内容。在进行kafka源码学习之前,先介绍一下Kafka的核心概念。

消息

消息是kafka中最基本的数据单元,由key和value组成,都是字节数组。key主要来实现路由功能,value是真正的有效负载。

topic&分区&Log

topic是用于存储消息的逻辑概念,是一个消息集合。

每个topic可以划分为多个分区,每个分区内的数据是不重叠的,每个消息在添加到分区时,都会分配一个编号offset,来保证消息在分区内的顺序。

分区在逻辑上对应着一个Log,当生产者将消息写入分区时,实际上是写入到了分区对应的Log中。Log是一个逻辑概念,可以对应磁盘上的一个文件夹,Log由多个Segment组成,每个Segment对应一个日志文件和索引文件。

保留策略&日志压缩

发送到kafka的数据会被保存下来,但不会像数据库那样永久保存,为了避免数据库被占满,kafka有相应的保留策略,周期性删除陈旧消息。kafka中有两种保留策略:基于时间和topic大小的保留策略。

kafka会对存储的消息进行压缩,以减少磁盘占用。

broker

一个单独的kafka server就是一个broker。broker的主要工作就是接收生产者发过来的消息,同时接收消费者的请求,返回存储的数据。一般一个broker占一台物理机器。

副本

kafka对消息进行了冗余备份,每个分区可以有多个副本,每个副本消息是一样的。每个分区至少有一个副本,所有副本中选取一个当做Leader,其它副本从Leader处拉取消息。

一般情况下,同一分区的多个副本会分配到不同的broker上。一个topic包括多个分区,每个分区的数据是不一样的,可以实现水平扩展,当数据量变大时可以增大分区的数量;每个分区有多个副本,多副本情况下可丢失其中某个副本。

参考书籍《Apache Kafka源码剖析》

相关推荐
心态还需努力呀1 小时前
CANN仓库通信库:分布式训练的梯度压缩技术
分布式·cann
indexsunny4 小时前
互联网大厂Java面试实战:Spring Boot微服务在电商场景中的应用与挑战
java·spring boot·redis·微服务·kafka·spring security·电商
TTBIGDATA5 小时前
【Atlas】Ambari 中 开启 Kerberos + Ranger 后 Atlas Hook 无权限访问 Kafka Topic:ATLAS_HOOK
大数据·kafka·ambari·linq·ranger·knox·bigtop
Coder_Boy_5 小时前
基于SpringAI的在线考试系统-相关技术栈(分布式场景下事件机制)
java·spring boot·分布式·ddd
程序员泠零澪回家种桔子8 小时前
分布式事务核心解析与实战方案
分布式
凯子坚持 c8 小时前
CANN 生态中的分布式训练利器:深入 `collective-ops` 项目实现高效多卡协同
分布式
岁岁种桃花儿8 小时前
Kafka从入门到上天系列第一篇:kafka的安装和启动
大数据·中间件·kafka
惊讶的猫9 小时前
rabbitmq实践小案例
分布式·rabbitmq
禁默10 小时前
打破集群通信“内存墙”:手把手教你用 CANN SHMEM 重构 AIGC 分布式算子
分布式·重构·aigc
惊讶的猫12 小时前
rabbitmq初步介绍
分布式·rabbitmq