kafka

Thomas214320 小时前
分布式·flink·kafka
kafka 存储flink changelog两种方式和形态Upsert Kafka | Apache Flink作为数据源,upsert-kafka 连接器会生成一个变更日志流,其中每条数据记录代表一次更新或删除事件。更准确地说,数据记录中的值会被解释为对同一键的上一个值进行更新(如果存在),如果对应的键尚不存在,则更新操作会被视为插入操作。以表为例,变更日志流中的数据记录会被解释为 UPSERT(即插入/更新),因为任何具有相同键的现有行都会被覆盖。此外,空值会被特殊解释:空值记录代表“删除”操作。
禾吾2 天前
kafka
Kafka基础-安装、基础命令等📢 此文档中的命令是基于mac或者linux,windows下需要把bin/xxx.sh替换成bin/windows/xxxx.bat
cpolar技术支持2 天前
java·docker·kafka·cpolar·kafka streams
Kafka Streams 窗口统计怎么验收:本地跑订单流聚合,用 cpolar 给同事看只读结果页做窗口统计时,我最怕的不是代码报错,而是代码没报错、数字却对不上。尤其是事件时间、窗口边界和迟到数据混在一起后,只看日志很难让测试同事快速确认结果。
MZA6662 天前
java·spring boot·kafka
Spring Boot 实战:基于自定义注解 + AOP 实现 Kafka 消息无侵入异步上送在日常的微服务开发中,我们经常需要将核心接口的调用数据(如入参、返参、耗时等)异步上报到 Kafka,供下游进行数据同步、审计或数据计算。
重庆小透明2 天前
java·分布式·微服务·架构·kafka
Kafka 完全指南:从基础组件到核心原理(包含面试题)在之前我介绍了rocketmq的架构包括基本认识,现在来介绍kafka,其实不管用没用过kafka大家或多或少都知道kafka吞吐量很大,那为什么大,并且kafka的架构又是什么样的,今天我们一起来看看。
一本正经的不务正业2 天前
分布式·kafka·rocketmq
kafka与RocketMQ的不同1:kafka 与rocketMQ的零拷贝 kafka 在使用时更偏向sendFile方式, sendfile只能用来搬运数据,不能对数据进行操作。整个过程在内核态完成,不经过用户态。 rocketMq使用时更偏向Mmap方式。通过内存映射的方式,用户态通过虚拟地址,可以直接读取修改内核态数据。
johnrui2 天前
kafka
kafka4.x单机版安装部署(单节点 KRaft 模式)既然只有根分区,建议把 Kafka 安装到 /opt/kafka 或 /home/your_user/kafka 下,数据目录也放在同一分区:
面向Google编程3 天前
flink·kafka·agent
Kafka 成了 Agent 的「共享内存」,Flink 成了它的「大脑」Confluent 官方博客里举了个例子:一位客户写信来问订单到哪了,客服 Agent 查了账户,看到状态是「已发货」,就回了句安抚的话。
醉颜凉3 天前
分布式·架构·kafka·ar
Kafka ISR与AR深度解析:副本同步机制核心概念关键词:Kafka、ISR、AR、副本同步、Leader选举、高可用、数据一致性在Kafka的分布式架构中,副本机制是保证高可用和数据一致性的基石。而**ISR(In-Sync Replicas)和AR(Assigned Replicas)**则是理解副本同步机制的两个核心概念。
2601_962295994 天前
python·spark·kafka·情感分析·大规模处理
Spark 和 Kafka 实现 Python 大规模情感分析用 Spark 和 Kafka 实现 大规模情感分析引言:为什么你的笔记本电脑在处理几百万条数据时会“崩溃”?
spter。4 天前
分布式·kafka
从一次关注到最终一致:Canal、Outbox 与 Kafka 如何解决关系链双写问题知光是一个知识获取与分享社区。用户可以发布图文“知文”、浏览首页 Feed、进入详情页查看作者,也可以关注作者。在页面上,一次关注看起来只是把按钮从“关注”切换成“已关注”,后台却要同时回答几类问题:A 关注了谁、谁关注了 B、A 一共关注了多少人、B 一共有多少粉丝,以及下一次打开列表时怎样快速返回结果。
creator_Li4 天前
kafka
Kafka的死信队列Kafka本身没有内置死信队列,死信队列是业务层面的设计方案:消费失败、无法正常处理的消息,转发到专门的死信 Topic,不再重复重试消费,避免阻塞消费。
想要打 Acm 的小周同学呀5 天前
分布式·kafka
Kafka消息队列出现挤压如何解决?如果 Kafka 中出现大量消息积压,消费速度长期低于生产速度,应该怎么处理?1先快速解决线上问题,看一下积压的是什么topic业务的数据,如果是日志、埋点、推荐系统的可以直接丢掉,让订单、支付等核心业务逻辑去跑。 本质是快速止血,减少业务的损失。
富士康质检员张全蛋5 天前
分布式·kafka
Kafka实战 自定义分区器 几种常见的分区器kafka topic是可以分为很多很多分区的,每一条消息在Kafka中存储的时候是要选择其中一个分区进行存储的,并且只能存在于一个分区当中。
starzy19905 天前
大数据·flink·kafka
Flink基础之Flink批流数据读取处理案例剖析:从文件到 Kafka 的完整代码前面三篇分别讲了有界/无界流、有状态计算、应用场景。这一篇把视角从「原理」拉回「写代码」:一个 Flink 作业到底是怎么把数据读进来、处理掉、再写出去的。不管什么业务,落到代码上都是同一套三段式结构——Source 读取 → Transform 转换 → Sink 写出——差异只在于数据源有界还是无界。
数智启示录6 天前
数据库·经验分享·分布式·缓存·面试·kafka·apache
Apache Kafka Consumer 扩到 40 个仍不提速:Partition 上限锁死有效并行度 【Kafka合集】告警显示 Lag 上升,值班同学把 Consumer 从 12 个扩到 40 个,吞吐没变,数据库连接却被打满。问题不是 Kafka 不支持水平扩展,而是实例数已经超过可用分区,并把瓶颈推向了下游。
数智启示录6 天前
数据库·经验分享·分布式·mysql·面试·kafka·apache
Apache Kafka 幂等 Producer 的边界:Exactly-Once 到了 MySQL 为什么失效 【Kafka合集】订单消费者先提交 MySQL,再发布积分事件;进程恰在两步之间崩溃。恢复后重放订单,积分被再次发放。Producer 的幂等开关没有失效——它根本看不见这次业务重放。
数智启示录6 天前
经验分享·分布式·面试·kafka·apache
Apache Kafka 不只是消息队列:日志与 Offset 分离如何让事件可重放 【Kafka合集】风控规则上线后,团队发现过去七天漏判了一类订单。订单服务没有重发接口,直接扫描业务库又会冲击线上。此时系统能否补算,不取决于消费者还能不能启动,而取决于七天前的事件是否仍在、消费位置能否独立回退、重复副作用是否可控。
数智启示录6 天前
大数据·数据库·经验分享·分布式·面试·kafka·apache
Apache Kafka 同 Key 仍会乱序:从分区 Offset 到业务可见的四道边界 【Kafka 合集】同一订单的“已支付”先在页面出现,“已创建”随后才到。团队确认两条消息 Key 都是订单号,于是把问题归因给 Kafka。可同 Key 只约束分区映射,不替应用生成顺序,也不替下游串行提交。
老周聊架构6 天前
mysql·flink·kafka
Flink 连接器与生态:Kafka Offset 提交修复与 MySQL Binlog 延迟指标Flink 之所以能在流计算领域站住,靠的不只是引擎本身,更靠连接器(Connector)生态这块基石。作业的「源头」和「去处」都长在连接器上:Kafka 取数、MySQL CDC 抓变更、Hudi/Iceberg 落湖、ClickHouse 写仓……连接器质量直接决定了一条流能不能「读得准、写得对、看得见」。