什么是数据仓库?

数据仓库:DATA WAREHOUSE,简称数仓、DW。是一个用于存储、分析、报告的数据系统。目的是构建面向分析的集成化数据环境,为企业提供决策支持。

数仓本身不"产生"任何数据,其数据来源于不同的外部系统;同时数仓本身也不"消费"任何数据,其结果开放给各个外部应用使用,这也是为什么叫"仓库",而不叫"工厂"的原因。

数仓的四大特征:

**面向主题的:**较高层次的企业信息系统中数据的综合、归类并进行分析利用,对应企业中某一宏观分析领域的所涉及的分析对象

**集成的:**在确定主题之后,就需要获取和主题相关的数据,在企业中某一个主题相关的数据通常会分布在不同的操作系统中,彼此分散、独立、异构。因此,在数据进入数据仓库之前,必须要经过统一和综合,对数据进行抽取、清洗、转换和综合,这一步是数仓建设过程中最为复杂且重要的一步,要统一数据源中所有的矛盾之处,例如字段同名异义,异名同义,单位不一致,长度不一致等问题。

**包含历史的:**数据仓库中包含各种粒度的历史数据,数据可能与某个特定的日期、星期、月份、季度或者年份有关。数据仓库中的数据时限要远远长于操作性数据库的数据时限,操作性数据库存储的是当前数据,而数仓存储的是历史数据,数仓中的数据是按照时间顺序追加的,它们都带有时间属性。

**相对稳定的:**数仓是分析数据的平台而不是创造数据的平台。我们是通过数仓去分析数据中的规律,而不是创造或者改变其中的规律,因此数据进入数仓后,便稳定且不会改变。操作型数据库主要服务于日常的业务操作,使得数据库需要不断地对数据进行更新以便获取最新的业务数据,不至于影响正常的业务运作。数仓是保存过去的业务数据,不需要对每一笔业务实时更新,而是根据商业需求每隔一段时间把一批较新的数据导入数据仓库。数据仓库反映的是一段相当长的时间内的历史数据,是不同时间点数据库快照的集合,以及基于这些快照进行统计、综合以及重组的导出数据,数仓用户对数据的操作大多是数据查询或者比较复杂的挖掘,一旦数据进入数仓后,一般情况下会被长时间保留,数仓中一般有大量的查询操作,修改和删除的操作很少。

相关推荐
ApacheSeaTunnel13 小时前
当多表数据涌入,Apache SeaTunnel 如何巧妙化解主键冲突?
大数据·开源·数据集成·seatunnel·技术分享·数据同步
大大大大晴天3 天前
Hudi Metadata Table 与 Hive Sync (HMS)怎么选?
大数据
手可摘星辰7774 天前
一次线上FlinkCDC异常排查复盘
大数据·flink
大大大大晴天4 天前
Hudi技术内幕:Metadata Table原理与实践
大数据
大大大大晴天5 天前
Hudi技术内幕:深入解析Index索引机制
大数据
阿里云大数据AI技术5 天前
Flink Forward Asia 2026 深圳启幕:Agentic Streaming for AI,开启实时智能新范式
大数据·flink
SelectDB5 天前
阶跃星辰基于 SelectDB 构建 PB 级 Agent 可观测平台
大数据·数据库·aigc
大大大大晴天9 天前
Hudi技术内幕:RecordPayload到RecordMerger
大数据
SelectDB9 天前
秒级弹性、最高降本 70%:SelectDB Serverless 如何重塑云数仓资源效率
大数据·后端·云原生
WhoAmI9 天前
MapReduce框架原理解析一:InputFormat
大数据·hadoop