企业《离线数仓项目》数据探索心得记录,数据探索有套路

思想

整体---细节:

探索一个系统所产生的数据,首先是从业务流程整体再到某个事实表细节。从大体到细节的过程。

熟悉整体框架:

先整体的了解业务流程,然后再根据某一个业务流程找到对应的事实表,然后再通过这张事实表的ID去关联其他事实表的ID,此步骤主要是为了将业务流程和业务事实表整体的数据关联打通,打通之后就得到了整个系统业务流程对应的事实表关联的整体框架。得到这个框架之后,这时就对整个业务流程以及业务流程所产生的表就比较清晰和熟悉了,因为你知道了整个业务的流程以及每一个流程所对应的事实表了。

探索事实表细节:

对整体业务框架和事实表有清晰的了解之后,再对某一个业务事实表进行展开细节探索,探索里面的字段对应的是什么,哪些业务操作产生的这些字段数据。然后再关联该事实表的维度表,知道该事实表对应关联了哪些维度表。

比如我想知道某个事实表中,有什么状态字段,该字段里面对应有什么状态就可以通过sql的group by来分组,看出有哪些状态信息。

这就是数据探索的大致思路。

探索的目的是为了后期项目使用,知道哪些业务对应的数据事实表,以及该表中存在和可能用到哪些字段。都要熟悉的了解,这样才能更高效的使用和利用数据。

相关推荐
CodeMartain1 小时前
Redis为什么快?
数据库·redis·缓存
Anastasiozzzz4 小时前
深入研究RAG: 在线阶段-查询&问答
数据库·人工智能·ai·embedding
卤炖阑尾炎7 小时前
基于 MySQL 主主复制 + HAProxy+Keepalived 构建高可用集群实战
数据库·mysql
Dxy12393102167 小时前
MySQL 如何高效删除大量数据:策略与最佳实践
数据库·mysql·oracle
倔强的石头_8 小时前
从 “不得不存” 到 “战略必争”:工业数据的价值觉醒之路
数据库
倔强的石头_8 小时前
新型电力系统应该用什么数据库?——时序数据库选型与落地实战
数据库
南汐以墨9 小时前
一个另类的数据库-Redis
数据库·redis·缓存
RInk7oBjo9 小时前
spring-事务管理
数据库·sql·spring
希望永不加班9 小时前
SpringBoot 数据库连接池配置(HikariCP)最佳实践
java·数据库·spring boot·后端·spring
黑牛儿9 小时前
MySQL 索引实战详解:从创建到优化,彻底解决查询慢问题
服务器·数据库·后端·mysql