数据仓库-维度设计

维度

在维度建模中,将度量称为"事实",将环境描述为"维度",维度是分析事实所需要的多样环境。

例如,在分析交易过程时,可以通过买家、卖家、商品和时间等维度描述交易发生的环境。

维度的基本设计方法

第一步:选择维度或新建维度。

作为维度建模的核心,在企业级数据仓库中必须保证维度的唯一性。

第二步:确定主维表

主维表一般是ODS表,直接与业务系统同步。

第三步:确定相关维表

根据对业务的梳理,确定哪些表和主维表存在关联关系,并选择其中的某些应用于生成维度属性。

第四步:确定维度属性

本步骤主要包括两个阶段,其中一个阶段是从主维表中选择维度属性或生成新的维度属性;第二个阶段是从相关维表中选择维度属性或生成新的维度属性。

缓慢变化维

数据仓库的重要特点之一是反映历史变化,所以如何处理维度的变化是维度设计的重要工作之一。缓慢变化维的提出是因为在现实世界中,维度的属性并不是静态的。它会随着时间的流逝发生缓慢的变化。与数据增长较为快速的事实表相比,维度变化相对缓慢。在Kimball的理论中,有三种处理缓慢变化维的方式。

方式一

重写维度值。采用此方式,不保留历史数据,始终取最新数据。

方式二

插入新的维度行。采用此方式,保留历史数据,维度值变化前的事实和过去的维度值关联,维度值变化后的事实和当前的维度值关联。

方式三

添加维度列,通过新列保存变化后的维度值。采用第二种处理方式不能将变化前后记录的事实归一为变化前的维度或归一为变化后的维度。

历史拉链存储就是利用缓慢变化维的第二种处理方式。这种处理方式是通过新增两个时间戳字段(start_dt和end_dt),将所有以天为粒度的变更数据都记录下来。通常分区字段也是时间戳字段。

相关推荐
2501_927283589 小时前
荣联汇智助力天津艺虹打造“软硬一体”智慧工厂,全流程自动化引领印刷包装行业数智变革
大数据·运维·数据仓库·人工智能·低代码·自动化
孤雪心殇14 小时前
快速上手数仓基础知识
数据仓库·hive·spark
渣渣盟17 小时前
数据仓库 vs 数据湖 vs 湖仓一体:架构演进与选型
数据仓库·架构
juniperhan1 天前
Flink 系列第22篇:Flink SQL 参数配置与性能调优指南:从 Checkpoint 到聚合优化
大数据·数据仓库·分布式·sql·flink
juniperhan1 天前
Flink 系列第21篇:Flink SQL 函数与 UDF 全解读:类型推导、开发要点与 Module 扩展
java·大数据·数据仓库·分布式·sql·flink
地球资源数据云2 天前
1960年-2024年中国棉花产量数据集
大数据·数据结构·数据仓库·人工智能
i建模2 天前
在数据仓库(数仓)中,给数据打标签(Tagging)
数据仓库
地球资源数据云3 天前
1900-2023年中国物种分布点位矢量数据集
大数据·数据结构·数据库·数据仓库·人工智能
Leo.yuan3 天前
数据仓库是什么?数据仓库和大数据平台、数据湖、数据中台、湖仓一体有什么区别?
大数据·数据仓库·spark
哥本哈士奇4 天前
数据仓库笔记 第六篇:PSA 层 SCD2 处理方式
数据仓库