flink

数智启示录1 天前
大数据·经验分享·面试·flink
Apache Doris 4.0.8 一致性实战(第 3 篇):Checkpoint 一直成功,Exactly-Once 为什么仍可能是假的Flink 作业连续运行三个月,Checkpoint 从未失败,Doris 导入任务也全部成功。月底对账却发现部分订单被重复累计,另一些订单停在旧状态。团队最容易得出的结论是 Doris Connector 没有做到 Exactly-Once。
数智启示录1 天前
大数据·数据库·经验分享·面试·flink
Apache Doris 4.0.8 CDC 正确性(第 9 篇):Flink Checkpoint 一直成功,表里为什么仍是旧数据Flink Checkpoint 和 Doris 2PC 都成功,订单 9001 却从已支付退回待支付。没有重复事务,也没有丢失事件;一条更旧的 CDC 记录最后到达,并被精确提交了一次。
Thomas21431 天前
大数据·flink
flink处理迟到数据WatermarkStrategy .forBoundedOutOfOrderness[Event](Duration.ofMinutes(5)) .withTimestampAssigner((event, _) => event.eventTime)
头茬韭菜3 天前
大数据·flink·fluss
图解 Fluss(五):Flink 接入与数据生命周期 —— Connector、表生命周期与冷热分层阅读本文你将了解: Flink 是怎么"发现"Fluss 表的、Split 与 Bucket 的映射关系、一条 CREATE TABLE 在集群内部要走几步、Schema Evolution 为什么只支持加列、以及热数据如何自动归档成 Iceberg/Parquet 并被同一条 SQL 查到。
StarRocks_labs3 天前
starrocks·flink·jni·native·paimon·湖仓·fluss
StarRocks × Fluss × Paimon:流湖仓分析与 ETL 闭环作者:段彦 阿里云高级研发工程师导读:在传统数据架构中,一份数据从业务系统产生,到最终支撑分析、风控、报表及对外服务,往往需要经过多套系统、多份存储和多次口径对齐。随着业务对秒级数据新鲜度、运维效率及湖仓能力提出更高要求,传统架构的局限也愈发明显。
数智启示录3 天前
大数据·数据库·经验分享·面试·flink
Doris精讲篇(六) 从第一批小文件到 -235:Doris 是怎样被正常写入拖死的每次 Stream Load 都成功,每批只有几十 KB,CPU 和磁盘也没有立刻打满。几小时后导入突然报 -235,业务以为遇到了随机故障。
StarRocks_labs3 天前
starrocks·flink·sstable·compaction·tablet·主键索引·存算分离架构
StarRocks 存算分离架构下的大规模实时导入优化实践作者:王衍波, StarRocks TSC Member;镜舟科技高级研发工程师导读:存算分离架构能够显著降低存储成本并提升系统弹性,但随着实时数据规模不断增长,对象存储请求、小文件、Compaction 以及 Publish 等环节逐渐成为大规模实时导入的性能瓶颈。针对这些挑战,StarRocks 围绕文件合并、大 Tablet、Tablet 内并行和主键索引优化等关键技术进行了系统性优化,并在多个生产场景中取得了显著效果。本文整理自王衍波在 Flink Forward Asia 2026 的分享,将介
ZCBUS实时计算5 天前
大数据·架构·flink·kafka·dba
信创混合存储架构落地实战|基于 ZCBUS 实时计算构建证券高可用实时风控数仓在证券两融、场外交易等核心业务场景中,风控系统需要基于实时资产、客户动态画像快速识别风险,传统 T+1 离线数仓无法满足业务时效要求。 而在信创改造的过渡阶段,项目架构面临多重难点:
效率工作实验室5 天前
flink·实时数据分析平台·流式分析引擎·流处理引擎对比·实时olap数据库
实时数据分析平台有哪些?流式分析引擎对比市面上的流式分析引擎从架构原理到使用体验差异很大,选型时如果只看产品名称和功能列表、不深入对比底层机制,上线后容易因延迟超标或状态管理瓶颈被迫重构。本文先定义五个对比维度,再逐款拆解七款主流引擎,最后给出对比速览表和场景化选型建议。
数智启示录5 天前
数据库·面试·sqlserver·flink
Flink CDC 机制精讲(四):一条 SQLServer CDC 事件如何保持顺序 【面试宝典】核心结论:顺序不是某一个组件提供的属性,而是一条从数据库日志顺序字段、稳定业务 Key、Kafka 分区、Flink keyBy、顺序状态到 JDBC 执行次序连续成立的约束链。
数智启示录5 天前
大数据·面试·flink
Flink CDC 机制精讲(五):Operator UID、Savepoint 与安全升级 【面试宝典】核心结论:Savepoint 保存的是“Operator ID → State”的映射。UID 的职责是稳定表达算子的逻辑身份,而不是让所有代码版本无条件共用同一份状态。
数智启示录5 天前
大数据·经验分享·面试·flink
Flink CDC 机制精讲(七):用故障注入证明链路是否可靠 【面试宝典】核心结论:正常路径成功只能证明链路能跑;只有在明确提交边界上主动制造故障,并用 Source 位点、Checkpoint、事务日志和目标数据共同举证,才能证明链路如何恢复。
存在morning5 天前
sql·学习·flink
【Flink SQL 学习笔记 三】维表关联:Lookup Join、Temporal Join、窗口 Join前两篇讲了流怎么进来、怎么聚合、怎么按窗口切分。但订单流里只有 ID——city_id、product_id,大盘看板上总不能给运营看一堆数字吧?得把 ID 换成名称:北京、上海、iPhone 15、MacBook Pro。这就是 Join 干的事:把订单流和维表关联起来,补全业务可读的字段。
数智启示录6 天前
大数据·经验分享·面试·flink
Flink CDC 机制精讲(二):Checkpoint Barrier 如何形成一致快照 【面试宝典】核心结论:Checkpoint 不是把整个任务同时暂停,而是让 Barrier 沿数据流划分“快照之前”和“快照之后”的记录,并把 Source 位点、算子状态和外部提交边界协调到同一个恢复点。
数智启示录6 天前
大数据·flink·kafka
实时数据湖 flink CDC + Kafka +Doris 【企业级实战】Checkpoint、Offset、事务与幂等如何闭环 06Source 与 Sink 在同一个 Job,但普通 JDBC Commit 仍不受 Flink 两阶段提交协调,因此语义是:
数智启示录6 天前
java·大数据·flink·kafka·数据库开发
实时数据湖 Flink CDC + Kafka +Doris 【企业级实战】之Kafka 事件缓冲层 【附核心源码】 04在当前项目中,Kafka 不只是消息队列,而是:这四种职责决定了 Kafka 层不能只写一句 producer.send(json)。
数智启示录6 天前
运维·flink·kafka
实时数据湖 flink CDC + Kafka +Doris 【企业级实战】性能调优与生产运维闭环 09第一版主要面对:第二版加入 Kafka 后,又增加:任何一段到达上限,调高其他段都不会提升整体吞吐。第一版已经证明,表分组不能走两个极端。第二版应继续演进为按权重分组:
存在morning6 天前
sql·学习·flink
【Flink SQL 学习笔记 二】实时聚合:用窗口和 Watermark 把订单按时段统计上一篇用 GROUP BY city 做了全局聚合——从任务启动到现在,每个城市一共多少订单。但业务场景不是这么用的:大盘要看"每分钟订单量",运营要看"近 5 分钟趋势",日报要看"当天累计 GMV"。这些需求都有时间边界——按时段切分,而不是无限累加。这就是窗口解决的问题:把无限的数据流切成一段段有限的,每段单独聚合。
吴声子夜歌6 天前
java·面试·flink
Java面试——Flink原理及应用(二)Flink被广泛应用于流式计算和批量计算中,其高吞吐量、低延迟和简单易用的API得到业界的一致好评。下面对Flink的安装和Flink API的使用进行简单介绍。
楠楠子呀9 天前
redis·python·容器·架构·flink·散列表·flume
从零构建高性能 WhatsApp 链接生成器与重定向服务:架构与路由解析在出海业务和独立站私域引流中,将用户从 Web 端引导至 WhatsApp 客户端是一个常见场景。传统的 wa.me 链接虽然简单,但在多国分流、渠道追踪、数据统计以及品牌管理方面存在一定局限。本文从技术角度介绍如何设计并实现一个 WhatsApp 链接生成与重定向服务(Link Generator)。