什么是数据仓库?

数据仓库:DATA WAREHOUSE,简称数仓、DW。是一个用于存储、分析、报告的数据系统。目的是构建面向分析的集成化数据环境,为企业提供决策支持。

数仓本身不"产生"任何数据,其数据来源于不同的外部系统;同时数仓本身也不"消费"任何数据,其结果开放给各个外部应用使用,这也是为什么叫"仓库",而不叫"工厂"的原因。

数仓的四大特征:

**面向主题的:**较高层次的企业信息系统中数据的综合、归类并进行分析利用,对应企业中某一宏观分析领域的所涉及的分析对象

**集成的:**在确定主题之后,就需要获取和主题相关的数据,在企业中某一个主题相关的数据通常会分布在不同的操作系统中,彼此分散、独立、异构。因此,在数据进入数据仓库之前,必须要经过统一和综合,对数据进行抽取、清洗、转换和综合,这一步是数仓建设过程中最为复杂且重要的一步,要统一数据源中所有的矛盾之处,例如字段同名异义,异名同义,单位不一致,长度不一致等问题。

**包含历史的:**数据仓库中包含各种粒度的历史数据,数据可能与某个特定的日期、星期、月份、季度或者年份有关。数据仓库中的数据时限要远远长于操作性数据库的数据时限,操作性数据库存储的是当前数据,而数仓存储的是历史数据,数仓中的数据是按照时间顺序追加的,它们都带有时间属性。

**相对稳定的:**数仓是分析数据的平台而不是创造数据的平台。我们是通过数仓去分析数据中的规律,而不是创造或者改变其中的规律,因此数据进入数仓后,便稳定且不会改变。操作型数据库主要服务于日常的业务操作,使得数据库需要不断地对数据进行更新以便获取最新的业务数据,不至于影响正常的业务运作。数仓是保存过去的业务数据,不需要对每一笔业务实时更新,而是根据商业需求每隔一段时间把一批较新的数据导入数据仓库。数据仓库反映的是一段相当长的时间内的历史数据,是不同时间点数据库快照的集合,以及基于这些快照进行统计、综合以及重组的导出数据,数仓用户对数据的操作大多是数据查询或者比较复杂的挖掘,一旦数据进入数仓后,一般情况下会被长时间保留,数仓中一般有大量的查询操作,修改和删除的操作很少。

相关推荐
livemetee4 小时前
Flink2.0学习笔记:使用HikariCP 自定义sink实现数据库连接池化
大数据·数据库·笔记·学习·flink
人大博士的交易之路4 小时前
龙虎榜——20250822
大数据·数据挖掘·数据分析·缠中说禅·龙虎榜·道琼斯结构
青云交14 小时前
Java 大视界 -- Java 大数据在智能安防人脸识别系统中的活体检测与防伪技术应用
java·大数据·生成对抗网络·人脸识别·智能安防·防伪技术·活体测试
chenglin01614 小时前
ES_索引模板
大数据·elasticsearch·jenkins
byte轻骑兵16 小时前
大数据时代时序数据库选型指南:深度解析与 Apache IoTDB 实践
大数据·apache·时序数据库
没有梦想的咸鱼185-1037-166317 小时前
SWMM排水管网水力、水质建模及在海绵与水环境中的应用
数据仓库·人工智能·数据挖掘·数据分析
NPE~17 小时前
[docker/大数据]Spark快速入门
大数据·分布式·docker·spark·教程
的小姐姐18 小时前
AI与IIOT如何重新定义设备维护系统?_璞华大数据Hawkeye平台
大数据·人工智能
TDengine (老段)19 小时前
TDengine IDMP 最佳实践
大数据·数据库·物联网·ai·时序数据库·tdengine·涛思数据
彬彬醤19 小时前
Mac怎么连接VPS?可以参考这几种方法
大数据·运维·服务器·数据库·线性代数·macos·矩阵