paimon

俊哥大数据1 天前
大数据·doris·湖仓一体·flinksql·paimon
基于 FlinkSQL + Paimon + Doris 的车联网流批一体湖仓实践 —— 第 1 章 业务背景与传统 Lambda 架构痛点系列定位:本系列以车联网 TSP(Telematics Service Provider)行程主题数仓为真实生产案例,完整复盘一套 Flink 1.20 + Paimon 1.4 + Doris 4.1 流批一体湖仓的架构设计、建设过程、上线部署、性能优化与踩坑总结。文中所有"踩坑"均为生产环境实测,非理论推演。
俊哥大数据1 天前
flink·doris·湖仓一体·paimon
基于 FlinkSQL + Paimon + Doris 的车联网流批一体湖仓实践 —— 第 2 章 流批一体湖仓总体架构与三条分区契约铁律系列定位:本系列以车联网 TSP 行程主题数仓为真实生产案例,完整复盘一套 Flink 1.20 + Paimon 1.4 + Doris 4.1 流批一体湖仓的架构设计、建设过程、上线部署、性能优化与踩坑总结。所有踩坑均为生产环境实测,非理论推演。
俊哥大数据1 天前
flink·doris·湖仓一体·paimon·流批一体
基于 FlinkSQL + Paimon + Doris 的车联网流批一体湖仓实践 —— 第 4 章 Kafka 企标报文入湖(ODS 表设计)系列定位:本系列以车联网 TSP 行程主题数仓为真实生产案例,完整复盘一套 Flink 1.20 + Paimon 1.4 + Doris 4.1 流批一体湖仓的架构设计、建设过程、上线部署、性能优化与踩坑总结。所有踩坑均为生产环境实测,非理论推演。
俊哥大数据1 天前
flink·doris·湖仓一体·paimon
基于 FlinkSQL + Paimon + Doris 的车联网流批一体湖仓实践 —— 第 3 章 Paimon 1.4 湖仓底座与 Catalog 配置系列定位:本系列以车联网 TSP 行程主题数仓为真实生产案例,完整复盘一套 Flink 1.20 + Paimon 1.4 + Doris 4.1 流批一体湖仓的架构设计、建设过程、上线部署、性能优化与踩坑总结。所有踩坑均为生产环境实测,非理论推演。
俊哥大数据11 天前
分布式·flink·kafka·数据湖·paimon
Flink1.20.3 实时消费 Kafka 数据并解析入湖 Paimon1.4.2 全流程实战场景:车联网 TBox 终端按国标 GB32960 协议上报报文,经网关接入 Kafka;Flink 以 Table API / SQL 直接将原始报文(Original)落湖 Paimon,形成 ODS 贴源层,供下游 Doris / Spark / Hive 查询与数仓分层加工。 本文基于生产实战整理,涵盖架构、建模、代码、配置、Checkpoint、打包、DolphinScheduler 调度、Savepoint 平滑启停全链路,可直接落地复用。
EatFan12 天前
starrocks·flink·硬件架构·doris·湖仓一体·paimon
从T+1到分钟级:湖仓一体在大厂的真实落地收益对照(携程/网易云信/腾讯)湖仓一体、流式湖仓的架构文章已经不稀缺。公开可见的工程分享里,Flink 与 Paimon/Fluss 组合承担流式入湖,再由 StarRocks、Doris、Hologres 或湖上直查承担分析侧,这套范式在抖音、淘天、携程、京东物流、蚂蚁、淘宝闪购等企业的实践分享中反复出现 [1][4][5][6][7][8]。但绝大多数团队在立项评审时仍会卡在同一个问题上:这些架构我看得懂,收益数字我算不出来。
StarRocks_labs1 个月前
starrocks·sql·paimon·variant·shredding
StarRocks 如何查询 Paimon 半结构化数据?Variant、Shredding 与 SQL 实践作者:王日宇(霁谦)StarRocks Committer;阿里云技术专家在电商订单、用户行为和设备日志等场景中,一条数据通常同时包含两类信息:
StarRocks_labs1 个月前
starrocks·flink·jni·native·paimon·湖仓·fluss
StarRocks × Fluss × Paimon:流湖仓分析与 ETL 闭环作者:段彦 阿里云高级研发工程师导读:在传统数据架构中,一份数据从业务系统产生,到最终支撑分析、风控、报表及对外服务,往往需要经过多套系统、多份存储和多次口径对齐。随着业务对秒级数据新鲜度、运维效率及湖仓能力提出更高要求,传统架构的局限也愈发明显。
StarRocks_labs1 个月前
starrocks·olap·schema·paimon·fluss·湖流一体
基于 Fluss、Paimon 与 StarRocks 构建淘天集团湖流一体数据链路作者:朱奥,淘天集团高级数据开发工程师导读:本文整理自淘天集团朱奥在 Flink Forward Asia 2026 的分享,介绍了 Fluss、Paimon 与 StarRocks 构建湖流一体架构的实践:Fluss 负责秒级实时数据,Paimon 沉淀历史数据,StarRocks 提供统一分析入口,实现秒级至历史数据的一体化分析。目前,该方案已实现开发效率提升 50% 以上、实时链路成本降低 80% 以上。
StarRocks_labs1 个月前
starrocks·kafka·lambda·查询·paimon·fluss·湖流一体
StarRocks x Fluss x Paimon 湖流一体方案:构建秒级响应、湖流一体的实时数据引擎StarRocks x Fluss x Paimon 湖流一体方案通过将 Apache Fluss(面向分析场景的实时流存储)与 Apache Paimon(高性能湖格式表)深度融合,以 StarRocks 作为统一查询入口,构建了一套具备秒级新鲜度、十倍成本降低、一份数据一次查询的全新实时数据引擎。本文将介绍该方案的核心架构、技术优势、查询模式以及实现原理。
StarRocks_labs1 个月前
starrocks·paimon·业务分析·多模态处理·混合检索·全模态能力·内容处理
StarRocks 全模态能力导读:连接内容理解、混合检索与业务分析作者:周康,阿里云开源 OLAP 引擎团队负责人;StarRocks TSC Member导读:当图片、视频和文档经过模型理解并转化为描述、标签和向量,业务需要解决的已不只是“如何找到相似内容”,还包括结构化过滤、混合检索及后续的关联分析。本文将介绍 StarRocks 为什么建设全模态能力,以及多模态处理、内表、Paimon 和 Lance 四个能力方向如何连接内容理解、检索与业务分析。
阿坤带你走近大数据4 个月前
flink·数据湖·paimon
Paimon相关概念的介绍Apache Paimon(原名 Flink Table Store)是专为 流批一体 设计的下一代数据湖存储格式。它不仅仅是一个文件格式,更是一个完整的 Streaming Data Lake Platform。
胖胖胖胖胖虎5 个月前
flink·paimon
Paimon Lookup Join 详解Lookup Join 是 Paimon 特有的一种维表关联方式。它不是标准 SQL 里的 join 类型,而是 Paimon 根据自身 LSM 存储特性设计出来的 *快照查询式 Join*。
老徐电商数据笔记7 个月前
apache·湖仓一体·paimon·湖仓
一个典型的基于 Apache Paimon 的湖仓一体架构图前面我们给出了:基于 Hudi 的湖仓一体架构图,我看很多伙伴挺感兴趣,今天我们一起来看看:基于 Apache Paimon 的湖仓一体架构图 是怎么样的?以及它和hudi之间的区别。
zhangkaixuan4567 个月前
大数据·flink·paimon·gravitino·datalake
Paimon 数据湖 + Gravitino 元数据中心:技术原理与实战指南Apache Paimon 是一个流批一体的数据湖存储格式,支持高吞吐的数据摄入和高效的实时/批量查询。Apache Gravitino 可以作为 Paimon 的统一元数据中心,通过 lakehouse-paimon Catalog 插件直接对接 Paimon 的元数据层,实现:
阿里云大数据AI技术8 个月前
starrocks·阿里云·spark·paimon
淘宝闪购基于阿里云 EMR Serverless Spark&Paimon 的湖仓实践:超大规模下的特征生产&多维分析双提效淘宝闪购从25年春天的横空出世,到秋天“第一杯奶茶”的火爆,再到今天成为广大消费者即时生活服务的日常,业务团队取得了巨大的突破,背后自然少不了技术团队的支撑。经过一年多的探索实践,闪购大数据团队沉淀了以Paimon为底座,流、批、分析多引擎协作的Lakehouse架构。本文介绍阿里云 Serverless Spark + Paimon在淘宝闪购大数据湖仓场景的应用。