【Kafka笔记】(一)认识 Kafka

一、什么是 Kafka

Kafka 是一款分布式、高吞吐、低延迟、持久化的消息队列/流处理平台。通俗的讲Kafka 就是一个"实时数据中转站+数据蓄水池"

  • 上游业务/设备产生数据 → 发给 Kafka 存起来

  • 下游 Flink、服务、数仓 → 从 Kafka 实时拉取数据计算

二、为什么大数据实时开发必须用 Kafka

如果没有 Kafka:

  • 业务系统直接调用计算服务,流量暴涨会直接打崩服务

  • 数据瞬时峰值过高,程序处理不过来导致丢失数据

  • 无法解耦生产端和消费端

有了 Kafka:

  • 削峰填谷:瞬时海量数据先缓存,下游慢慢消费

  • 解耦:生产者只管发,消费者只管读,互不影响

  • 持久化:数据落盘,不会丢失,支持回溯消费

  • 高吞吐:支撑百万级 QPS,车联网、日志、实时数据首选

三、应用场景

1. 实时数据传输

车联网、物联网设备实时上报数据

2. 实时计算

配合 Flink 做实时清洗、统计、告警

3. 日志收集

系统日志、操作日志实时采集

4. 业务解耦

订单、支付、消息推送异步处理

5. 数据同步

实时同步数据库、数仓数据

相关推荐
一隅论数智3 天前
给AI一张“业务概念地图“:本体如何从哲学走向企业智能
大数据·人工智能·经验分享·笔记·学习·学习方法·政务
深圳老胡3 天前
STM32F407 控制 L6470 步进电机驱动 —— 控制过程简介
笔记·stm32·单片机·嵌入式硬件·代码规范
Because_of_Her13 天前
并查集-听课笔记
笔记·算法·并查集
彧azz3 天前
Linux 环境下 Redis 学习总结:数据类型、持久化、锁、事务、主从与缓存问题
linux·redis·笔记·学习·面试
陈卫军老师3 天前
陈卫军:把口味写在一张纸上,店才稳得住
经验分享·笔记·流量运营
`流年づ3 天前
人工智能学习笔记 - 补充
人工智能·笔记·深度学习·学习
qeen873 天前
【Linux】操作系统之进程介绍(二)
linux·笔记·学习·进程
Thomas.Sir3 天前
第21课:PyTorch|GPU多卡训练与分布式训练基础【让多卡并行成为你的加速引擎】
人工智能·pytorch·分布式
从零开始的嵌入式之旅3 天前
day47
arm开发·经验分享·笔记·嵌入式硬件
Cicada1283 天前
库存消息消费的正确性设计——从幂等窗口到批量流水线
分布式·系统架构