kafka 相关概念

1 kafka 生产者

kafka 用push的方式把消息推送到topic

每个topic下可以有多个分区,

可以用hash 也可以用轮询的方式指定分区

每个分区内部是可以保证顺序的,但是整体无法保证顺序,除非设置成一个topic只有一个分区。

kafka这种多分区的设置 带来的好处:

1.一般来说每个分区下面代表的是一台机器,对于生产者来说相当于提升了kafka的写速度。

2.对于生产者来说增加分区,还提升了存储能力。

3.对于消费者来说,一般是每台机器对应一个分区,所以提升了kafka的读能力。

其实就是高吞吐量

生产者分区&日志

消费者

高速写入

kafka的日志是以磁盘的方式保存的,一般认为在磁盘写速度较低

kafka 使用了顺序写,并且使用了MMFile (memory,mapped File)内存映射空间。来实现高速写入

内存映射技术原理就是,kafka在操作系统内核开辟了一个空间,这个空间关联了一个磁盘空间,每次写入的时候直接操作这个内核空间,然后由操作系统决定什么时候真正写入磁盘。

这种设计由一个问题,就是写入内核后,还没来得及同步就宕机了,数据会丢失。

解决的方式就是不写入内核,直接写入磁盘。

嗯,然后 写速度大大下降。可能得不偿失。

任何设计都不可能完美,在安全与速度之间会有取舍。

高速读取

kafka在响应客户读取的时候使用zerocopy技术,直接将数据通过内核空间传递出去。数据并没有抵达用户空间

传统io:

1.磁盘中的数据copy到内核缓冲区

2.内核缓冲区copy到用户缓冲区

3.用户缓冲区copy到socket缓冲区

4.socket copy到相关协议发送区

zeroCopy

1.磁盘中的数据copy到内核缓冲区

2.内核copy到socket相关缓冲区

3.socket copy到相关协议发送区

相关推荐
组合缺一1 天前
论 AI Skills 分布式发展的必然性:从单体智能到“云端大脑”的跃迁
java·人工智能·分布式·llm·mcp·skills
麦兜*1 天前
深入解析云原生时代的高性能消息中间件:基于Apache Pulsar与Kafka架构对比的万亿级数据吞吐与低延迟实时处理实战
云原生·kafka·apache
shepherd1261 天前
深度剖析SkyWalking:从内核原理到生产级全链路监控实战
分布式·后端·skywalking
DolphinScheduler社区1 天前
Linux 环境下,Apache DolphinScheduler 如何驱动 Flink 消费 Kafka 数据?
linux·flink·kafka·开源·apache·海豚调度·大数据工作流调度
h7ml1 天前
基于 RabbitMQ 构建异步化淘客订单处理流水线:解耦、削峰与失败重试
分布式·rabbitmq·ruby
夜月蓝汐1 天前
分布式监控SkyWalking链路追踪
分布式·skywalking
shandongtianhe1 天前
分布式光伏气象站:实现对光伏电站所处环境的多参数、实时化、高精度监测
分布式
源代码•宸1 天前
分布式理论基础——Raft算法
经验分享·分布式·后端·算法·golang·集群·raft
J_liaty1 天前
XXL-Job 实现分布式定时任务
分布式·xxl-job
小北方城市网2 天前
Redis 分布式锁高可用实现:从原理到生产级落地
java·前端·javascript·spring boot·redis·分布式·wpf