湖仓一体

俊哥大数据1 天前
大数据·doris·湖仓一体·flinksql·paimon
基于 FlinkSQL + Paimon + Doris 的车联网流批一体湖仓实践 —— 第 1 章 业务背景与传统 Lambda 架构痛点系列定位:本系列以车联网 TSP(Telematics Service Provider)行程主题数仓为真实生产案例,完整复盘一套 Flink 1.20 + Paimon 1.4 + Doris 4.1 流批一体湖仓的架构设计、建设过程、上线部署、性能优化与踩坑总结。文中所有"踩坑"均为生产环境实测,非理论推演。
俊哥大数据1 天前
flink·doris·湖仓一体·paimon
基于 FlinkSQL + Paimon + Doris 的车联网流批一体湖仓实践 —— 第 2 章 流批一体湖仓总体架构与三条分区契约铁律系列定位:本系列以车联网 TSP 行程主题数仓为真实生产案例,完整复盘一套 Flink 1.20 + Paimon 1.4 + Doris 4.1 流批一体湖仓的架构设计、建设过程、上线部署、性能优化与踩坑总结。所有踩坑均为生产环境实测,非理论推演。
俊哥大数据1 天前
flink·doris·湖仓一体·paimon·流批一体
基于 FlinkSQL + Paimon + Doris 的车联网流批一体湖仓实践 —— 第 4 章 Kafka 企标报文入湖(ODS 表设计)系列定位:本系列以车联网 TSP 行程主题数仓为真实生产案例,完整复盘一套 Flink 1.20 + Paimon 1.4 + Doris 4.1 流批一体湖仓的架构设计、建设过程、上线部署、性能优化与踩坑总结。所有踩坑均为生产环境实测,非理论推演。
俊哥大数据1 天前
flink·doris·湖仓一体·paimon
基于 FlinkSQL + Paimon + Doris 的车联网流批一体湖仓实践 —— 第 3 章 Paimon 1.4 湖仓底座与 Catalog 配置系列定位:本系列以车联网 TSP 行程主题数仓为真实生产案例,完整复盘一套 Flink 1.20 + Paimon 1.4 + Doris 4.1 流批一体湖仓的架构设计、建设过程、上线部署、性能优化与踩坑总结。所有踩坑均为生产环境实测,非理论推演。
EatFan12 天前
starrocks·flink·硬件架构·doris·湖仓一体·paimon
从T+1到分钟级:湖仓一体在大厂的真实落地收益对照(携程/网易云信/腾讯)湖仓一体、流式湖仓的架构文章已经不稀缺。公开可见的工程分享里,Flink 与 Paimon/Fluss 组合承担流式入湖,再由 StarRocks、Doris、Hologres 或湖上直查承担分析侧,这套范式在抖音、淘天、携程、京东物流、蚂蚁、淘宝闪购等企业的实践分享中反复出现 [1][4][5][6][7][8]。但绝大多数团队在立项评审时仍会卡在同一个问题上:这些架构我看得懂,收益数字我算不出来。
Lancker19 天前
湖仓一体
湖仓一体(Lakehouse)知识全解从数据仓库 → 数据湖 → 湖仓一体的完整演进 · 核心技术 · 代码示例 · 选型指南 大数据架构IcebergHudiDelta Lake2026 整理
Moshow郑锴20 天前
数据仓库·data·湖仓一体
从“水库”到“直饮水站”:重新理解 Data Mart 与 Data Lake、Data Lakehouse、Data Warehouse 的区别如果把数据体系比作一套“城市供水系统”,这四个概念会立刻清晰很多:下面用这个比喻,重新梳理它们之间的关系,尤其是 Data Mart 与 Data Lake、Data Lakehouse 的区别。
SelectDB技术团队1 个月前
大数据·doris·数据湖·湖仓一体·lakehouse·湖仓分析·多模分析
Apache Doris 5.0 年度版本前瞻(一):构建统一的多模湖仓实时分析平台导读:本文主要介绍 Apache Doris 5.0 针对多模湖仓的核心演进:核心理念:统一检索走向开放湖仓,基于 Doris 构建统一的多模态数据分析平台。
迈巴赫车主3 个月前
大数据·数据仓库·数据湖·湖仓一体
湖仓一体(Data Lakehouse)简介湖仓一体是融合数据湖 + 数据仓库优势的新一代统一大数据架构,底层共用一套低成本对象存储,上层同时具备湖的灵活存储、仓的高性能治理与 SQL 分析能力,一套数据同时支撑实时计算、离线报表、BI 可视化、AI 建模,消除传统 “湖仓分离双架构” 的数据孤岛、重复存储、口径不一致痛点。
递归尽头是星辰4 个月前
lambda·湖仓一体·大数据架构·kappa·数据仓库分层
大数据架构体系通识:存储、架构与数仓分层全解析本文梳理大数据存储形态、工程架构、数仓分层三大核心体系,解析传统数仓、数据湖、湖仓一体三类存储方案,详解 EDW、Lambda、Kappa、流批一体四大主流架构及其衍生变体,阐释五层数仓分层规范,补充小众落地架构与选型规则,完整呈现大数据架构从理论到生产落地的全体系内容。
james的分享5 个月前
hudi·湖仓一体
湖仓一体之Apache HudiApache Hudi Hudi(Hadoop Upserts Deletes and Incrementals)是一个面向数据湖(Data Lake)的开放表格式(Open Table Format)与数据管理框架,主要解决:
hf2000126 个月前
大数据·spark·数据湖·湖仓一体·lakehouse
深入分析:Iceberg v3「删除向量(Deletion Vectors, DV)」如何缓解 CDC 场景写放大CDC(Change Data Capture)入湖常见形态是持续 UPDATE/DELETE/INSERT(尤其 Upsert)。在“不可变数据文件(Parquet/ORC)+ 表格式元数据”的体系里,写放大主要来自三层:
hf2000126 个月前
大数据·spark·数据湖·湖仓一体·lakehouse
Apache Iceberg vs Apache Paimon :数据湖表格式深度对比与选型指南在数据湖表格式的演进中,Apache Iceberg 和 Apache Paimon 走出了两条截然不同但又殊途同归的路线:
蓝魔Y6 个月前
湖仓一体
湖仓一体(LakeHouse)框架===================================== over ================================================
百度Geek说6 个月前
clickhouse·湖仓一体·lakehouse·数据引擎·存算分离
百度MEG数据中台ClickHouse在数据湖仓中的探索和应用随着图灵3.0生态在业务中不断深入,数据量和分析需求飞速增长,传统ClickHouse架构面临成本高昂、即席探索链路冗长以及故障恢复缓慢等问题。
hf2000127 个月前
架构·数据湖·湖仓一体·lakehouse
美团 x 云器|从美团BI平台升级看数据引擎架构升级演进路径导读本周,美团基础研发平台发布了《美团 BI 在指标平台和分析引擎上的探索和实践》一文,详细披露了其BI平台基于云器Lakehouse的引擎升级探索与实践。作为国内头部互联网公司的核心数据基础设施,美团的这一技术选型与实践经验,对于整个行业具有较高的参考价值。
SelectDB技术团队7 个月前
数据库·postgresql·架构·实时数仓·湖仓一体·apache doris·selectdb
PostgreSQL + Apache Doris:构建用于实时分析的 HTAP 架构像 PostgreSQL 和 MySQL 这样的 OLTP(在线事务处理)数据库,凭借其强一致性和高并发事务处理能力,已成为行业标准。为应对更大规模的工作负载,许多团队还会引入分库分表方案,将数据分布到多个实例和表中,以此突破单节点瓶颈。然而,这种对事务行之有效的方案,在实时分析需求(实时运营仪表盘、多维业务报告、用户行为分析和实时监控)面前却暴露出明显短板。
老徐电商数据笔记7 个月前
apache·湖仓一体·paimon·湖仓
一个典型的基于 Apache Paimon 的湖仓一体架构图前面我们给出了:基于 Hudi 的湖仓一体架构图,我看很多伙伴挺感兴趣,今天我们一起来看看:基于 Apache Paimon 的湖仓一体架构图 是怎么样的?以及它和hudi之间的区别。
Light608 个月前
大数据·数据仓库·数据湖·ipaas·湖仓一体·数据中台·领码 spark
不止于名:领码 SPARK 如何“链”动数据仓库、数据湖、中台与湖仓一体新纪元本文旨在深度剖析商业融合平台“领码 SPARK”与现代企业数据领域五大核心架构——数据仓库、大数据平台、数据湖、数据中台、湖仓一体之间的深层关系。报告首先厘清了“领码 SPARK”与开源计算引擎 Apache Spark 的本质区别,明确其作为“iPaaS+aPaaS”双引擎融合平台的定位。随后,文章系统梳理了五大架构的演进脉络与核心价值,并在此基础上,通过详尽的场景分析和架构解构,论证了领码 SPARK 如何作为“数据动脉”、“智能管家”、“服务化引擎”和“AI 加速器”,无缝集成并赋能这五种架构。本文
阿坤带你走近大数据9 个月前
大数据·数据湖·湖仓一体
数据湖的构建实施方法论构建数据湖(Data Lake) 是现代企业实现数据集中化、支持 AI/BI/实时分析的关键基础设施。与传统数据仓库不同,数据湖以低成本、高扩展性、多格式支持为核心优势,但若设计不当,极易沦为“数据沼泽”(Data Swamp)——数据混乱、不可信、难使用。