什么是数据仓库?

数据仓库:DATA WAREHOUSE,简称数仓、DW。是一个用于存储、分析、报告的数据系统。目的是构建面向分析的集成化数据环境,为企业提供决策支持。

数仓本身不"产生"任何数据,其数据来源于不同的外部系统;同时数仓本身也不"消费"任何数据,其结果开放给各个外部应用使用,这也是为什么叫"仓库",而不叫"工厂"的原因。

数仓的四大特征:

**面向主题的:**较高层次的企业信息系统中数据的综合、归类并进行分析利用,对应企业中某一宏观分析领域的所涉及的分析对象

**集成的:**在确定主题之后,就需要获取和主题相关的数据,在企业中某一个主题相关的数据通常会分布在不同的操作系统中,彼此分散、独立、异构。因此,在数据进入数据仓库之前,必须要经过统一和综合,对数据进行抽取、清洗、转换和综合,这一步是数仓建设过程中最为复杂且重要的一步,要统一数据源中所有的矛盾之处,例如字段同名异义,异名同义,单位不一致,长度不一致等问题。

**包含历史的:**数据仓库中包含各种粒度的历史数据,数据可能与某个特定的日期、星期、月份、季度或者年份有关。数据仓库中的数据时限要远远长于操作性数据库的数据时限,操作性数据库存储的是当前数据,而数仓存储的是历史数据,数仓中的数据是按照时间顺序追加的,它们都带有时间属性。

**相对稳定的:**数仓是分析数据的平台而不是创造数据的平台。我们是通过数仓去分析数据中的规律,而不是创造或者改变其中的规律,因此数据进入数仓后,便稳定且不会改变。操作型数据库主要服务于日常的业务操作,使得数据库需要不断地对数据进行更新以便获取最新的业务数据,不至于影响正常的业务运作。数仓是保存过去的业务数据,不需要对每一笔业务实时更新,而是根据商业需求每隔一段时间把一批较新的数据导入数据仓库。数据仓库反映的是一段相当长的时间内的历史数据,是不同时间点数据库快照的集合,以及基于这些快照进行统计、综合以及重组的导出数据,数仓用户对数据的操作大多是数据查询或者比较复杂的挖掘,一旦数据进入数仓后,一般情况下会被长时间保留,数仓中一般有大量的查询操作,修改和删除的操作很少。

相关推荐
techdashen4 分钟前
Cloudflare Agents Week 2026 总结:20 项发布,一张 Cloud 2.0 的完整地图
大数据·elasticsearch·搜索引擎
paperzz论文32 分钟前
从选题到见刊:Paperzz 期刊论文智能写作,如何让学术发表 “一键提速”?
大数据·人工智能·ai·论文·ai写作
极欧互联1 小时前
2026素材网站推荐排行 商用/自媒体/影视后期专用
大数据·人工智能·媒体
ROBOTGEEKER1 小时前
新能源汽车车门涂胶:越疆机器人,让密封精度与柔性生产双升级
大数据·机器人·制造
倒流时光三十年1 小时前
PostgreSQL 之 BRIN 索引应用场景
大数据·postgresql·brin 索引
科研前沿1 小时前
深耕像素实景重构,夯实视频孪生技术根基——锻造硬核底层能力,铸就镜像视界行业标杆
大数据·人工智能·数码相机·机器学习·重构
AI_Auto1 小时前
【转载】- 欧美制造企业AI+PLM现状及意向调研白皮书
大数据·人工智能·制造
成旭先生1 小时前
【2026】企业工商照面信息查询:深入了解企业的33项核心数据
大数据·大模型·geo
Volunteer Technology1 小时前
Hadoop NameNode HA
大数据·hadoop·分布式
callJJ1 小时前
Git 分支合并到测试分支(dep-qa)教程
大数据·git·elasticsearch