kafka入门(七):kafka实现高吞吐量

kafka 高吞吐量

顺序写入磁盘

Kafka 使用 磁盘来存储和缓存消息。

Kafka 只能在日志文件的尾部追加新的消息,也就是 顺序写入磁盘。

顺序写入磁盘,让 Kafka 能实现更高的吞吐量。

页缓存

Kafka中大量使用页缓存,这是Kafka 实现高吞吐的重要因素之一。

页缓存,是操作系统实现的一种磁盘存储,用来减少对磁盘 IO 的操作。就是 把磁盘中的数据缓存到内存中,把对磁盘的访问变为对内存的访问

当一个进程准备读取磁盘上的文件内容时,操作系统会先查看待读取的数据所在的页(page) 是否在页缓存(pageCache) 中,如果存在则直接返回数据,从而避免了对物理磁盘的 IO 操作。如果没有,则操作系统会向磁盘发起读取请求并将读取的数据页存入页缓存中,之后再将数据返回给进程。

当一个进程准备将数据写入磁盘时,操作系统也会检查数据对应的页是否在页缓存中,如果不存在,则先在页缓存中添加相应的页,最后将数据写入对应的页。被修改过的页也就变成了脏页,操作系统会在合适的时间,把脏页中的数据写入磁盘,以保持数据的一致性。

零拷贝

除了 顺序写入磁盘、页缓存,Kafka 还使用 零拷贝 (Zero-Copy) 来提升性能。

零拷贝就是指将数据直接从磁盘文件复制到网卡设备中,而不需要经过应用程序。减少了内核和用户模式之间的上下文切换。

对 Linux 系统而言,零拷贝技术依赖于底层的 sendfile() 方法实现。

对 Java 语言,FileChannal.transferTo() 方法的底层实现就是 sendfile() 方法。

资料来源:

《深入理解Kafka:核心设计与实践原理》

相关推荐
Mephisto.java2 小时前
【大数据学习 | Spark】Spark的改变分区的算子
大数据·elasticsearch·oracle·spark·kafka·memcache
KevinAha9 小时前
Kafka 3.5 源码导读
kafka
求积分不加C9 小时前
-bash: ./kafka-topics.sh: No such file or directory--解决方案
分布式·kafka
nathan05299 小时前
javaer快速上手kafka
分布式·kafka
激流丶12 小时前
【Kafka 实战】Kafka 如何保证消息的顺序性?
java·后端·kafka
天冬忘忧18 小时前
Kafka 工作流程解析:从 Broker 工作原理、节点的服役、退役、副本的生成到数据存储与读写优化
大数据·分布式·kafka
工业甲酰苯胺20 小时前
Python脚本消费多个Kafka topic
开发语言·python·kafka
B站计算机毕业设计超人1 天前
计算机毕业设计SparkStreaming+Kafka新能源汽车推荐系统 汽车数据分析可视化大屏 新能源汽车推荐系统 汽车爬虫 汽车大数据 机器学习
数据仓库·爬虫·python·数据分析·kafka·数据可视化·推荐算法
谷大羽1 天前
Kafka Stream实战教程
spring boot·后端·中间件·kafka·stream
求积分不加C1 天前
Kafka怎么发送JAVA对象并在消费者端解析出JAVA对象--示例
java·分布式·kafka·linq