数据湖

躺柒3 天前
数据仓库·架构·数据分析·数据湖·数据架构·关系数据库
读数据架构知识体系指南16数据网格(上)1.1. Zhamak Dehghani创造了数据网格(data mesh)一词1.1.1. 数据网格是一个概念,而不是一种技术
躺柒4 天前
大数据·数据仓库·数据分析·数据湖·数据编织
读数据架构知识体系指南14数据编织1.1. 数据编织是现代数据仓库构架(MDW)的进化1.2. 数据编织贯穿整个公司,累积了所有数据,将其提供给所有需要的人
躺柒5 天前
大数据·数据分析·数据湖·mdm·rdm
读数据架构知识体系指南13现代数据仓库1.1. 每天,各个组织都必须梳理海量数据,以获取深刻见解、做出决策并推动业务增长1.2. 融合了关系数据仓库的结构化优势和数据湖的灵活性优势
俊哥大数据11 天前
分布式·flink·kafka·数据湖·paimon
Flink1.20.3 实时消费 Kafka 数据并解析入湖 Paimon1.4.2 全流程实战场景:车联网 TBox 终端按国标 GB32960 协议上报报文,经网关接入 Kafka;Flink 以 Table API / SQL 直接将原始报文(Original)落湖 Paimon,形成 ODS 贴源层,供下游 Doris / Spark / Hive 查询与数仓分层加工。 本文基于生产实战整理,涵盖架构、建模、代码、配置、Checkpoint、打包、DolphinScheduler 调度、Savepoint 平滑启停全链路,可直接落地复用。
分布式存储与RustFS17 天前
iceberg·数据湖·对象存储·minio·s3·rustfs·ai存储
对象存储正在吞掉数据湖:RustFS 1.0 GA 与 MinIO AIStor Tables 把 2026 风向说清楚过去十年,搞数据的团队基本是两套系统在并行跑。对象存储(S3 及兼容方案)放图片、日志、模型权重、备份这些非结构化 blob;另一边再养一套独立的元数据和表引擎(Hive Metastore、Delta Lake、Iceberg catalog)去管结构化的表。两套系统意味着两份权限、两份治理、两份账单,还要写一堆把对象路径和表元数据对齐的胶水管道。
躺柒20 天前
数据仓库·架构·数据分析·spark·数据湖·关系数据库·企业数据仓库
读数据架构知识体系指南01关系数据仓库(上)1.1. 关系数据仓库(RDW)是一个集中存储和管理来自多个数据源的大量结构化数据的地方,用于生成历史和趋势分析报表,为公司的商业决策提供帮助
qingwufeiyang_53022 天前
数据仓库·数据湖
IceBerg学习笔记2三范式目的:数据唯一+减少数据冗余事实表:包含维度+指标 (是一个高表、宽表)如何构建数仓?分层构建数仓-不同的层采用不同的构建方式
凤山老林1 个月前
数据湖·flink cdc
实战笔记:Spring Boot 结合 Flink CDC 与 Iceberg 落地实时数据湖最近带团队重构公司的数据底座,把以前那套“Canal + Kafka + Flink + Hive”的老古董换成了“Flink CDC + Iceberg”的实时数据湖。过程中踩了不少坑,也摸索出一些最佳实践。这篇文章不讲虚的,直接从一线开发的视角,聊聊怎么用 Spring Boot 做管控基座,把 Flink CDC 和 Iceberg 串起来,搞定流式 ETL、Schema 自动演进和 Exactly-Once。
SelectDB技术团队1 个月前
大数据·doris·数据湖·湖仓一体·lakehouse·湖仓分析·多模分析
Apache Doris 5.0 年度版本前瞻(一):构建统一的多模湖仓实时分析平台导读:本文主要介绍 Apache Doris 5.0 针对多模湖仓的核心演进:核心理念:统一检索走向开放湖仓,基于 Doris 构建统一的多模态数据分析平台。
迈巴赫车主3 个月前
大数据·数据仓库·数据湖·湖仓一体
湖仓一体(Data Lakehouse)简介湖仓一体是融合数据湖 + 数据仓库优势的新一代统一大数据架构,底层共用一套低成本对象存储,上层同时具备湖的灵活存储、仓的高性能治理与 SQL 分析能力,一套数据同时支撑实时计算、离线报表、BI 可视化、AI 建模,消除传统 “湖仓分离双架构” 的数据孤岛、重复存储、口径不一致痛点。
不吃天鹅肉4 个月前
大数据·数据湖
数据湖Delta Lake 初试在现有 Hive 3.x + Spark 3.x + YARN 的集群中,我们希望引入 Delta Lake 作为数据湖的事务存储层,以解决 Hive ACID 表与 Spark 之间的兼容性问题(尤其是 Spark 无法直接读取 Hive ACID 托管表)。要求:不影响现有 Hive 服务,无需重启 HDFS 或 YARN。
阿坤带你走近大数据4 个月前
flink·数据湖·paimon
Paimon相关概念的介绍Apache Paimon(原名 Flink Table Store)是专为 流批一体 设计的下一代数据湖存储格式。它不仅仅是一个文件格式,更是一个完整的 Streaming Data Lake Platform。
递归尽头是星辰4 个月前
数据湖·乐观锁·mvcc·分布式架构·多版本控制
不同架构层级下的多版本设计:从业务设计到微服务与大数据层多版本控制是分布式系统中用于解决并发冲突、数据一致性、服务兼容与变更可追溯的通用架构模式。本文以 MySQL InnoDB MVCC 为基础,按数据库内核、业务设计、微服务、大数据、运维发布五个层级展开,给出各层级多版本控制的实现机制、工程约束与选型依据,构建从原理到落地的完整技术体系。
XSKY星辰天合5 个月前
数据湖·对象存储·分布式存储
从“能存下”到“训得动”:XSKY XEOS 支撑头部 AI 实验室建设 EB 级数据湖大模型规模化训练正加速推动 AI 数据湖突破规模临界点,也让企业和科研机构陷入一个核心困境:数据湖“能存下”不难,“存得统一、用得高效”却愈发艰难。
hf2000126 个月前
大数据·spark·数据湖·湖仓一体·lakehouse
深入分析:Iceberg v3「删除向量(Deletion Vectors, DV)」如何缓解 CDC 场景写放大CDC(Change Data Capture)入湖常见形态是持续 UPDATE/DELETE/INSERT(尤其 Upsert)。在“不可变数据文件(Parquet/ORC)+ 表格式元数据”的体系里,写放大主要来自三层:
hf2000126 个月前
大数据·spark·数据湖·湖仓一体·lakehouse
Apache Iceberg vs Apache Paimon :数据湖表格式深度对比与选型指南在数据湖表格式的演进中,Apache Iceberg 和 Apache Paimon 走出了两条截然不同但又殊途同归的路线:
Henb9296 个月前
数据湖
# Iceberg 数据湖实战系列: 新技术实战系列 难度: ⭐⭐⭐⭐⭐ 适合人群: 5 年 + 大数据工程师、数据平台架构师 前置知识: Hadoop 生态、数据仓库概念、Spark/Flink
hf2000127 个月前
架构·数据湖·湖仓一体·lakehouse
美团 x 云器|从美团BI平台升级看数据引擎架构升级演进路径导读本周,美团基础研发平台发布了《美团 BI 在指标平台和分析引擎上的探索和实践》一文,详细披露了其BI平台基于云器Lakehouse的引擎升级探索与实践。作为国内头部互联网公司的核心数据基础设施,美团的这一技术选型与实践经验,对于整个行业具有较高的参考价值。
ApacheSeaTunnel7 个月前
数据库·数据仓库·数据湖·白鲸开源
(三)ODS/明细层落地设计要点:把数据接入层打造成“稳定可运维”的基础设施在现代数据仓库架构中,ODS(Operational Data Store,操作型数据存储层)承担着承接业务系统数据、保持最细粒度事实、并为后续数据建模提供稳定输入的关键角色。它既是数据进入数仓体系的第一站,也是数据质量与可追溯能力的第一道防线。