数据仓库

weixin_307779131 天前
运维·数据仓库·python·spark·云计算
Databricks里用PySpark统计指定表和字段中各字段的空值、空字符串或零值比例
fastjson_3 天前
数据仓库·hive·hadoop
Hive 基础函数unix_timestamp 函数是将一个字符串,变为了一个时间戳 from_unixtime 函数是将时间戳变为了一个字符串
APItesterCris4 天前
大数据·数据库·数据仓库·自动化
告别人工盯品:借助 OpenClaw 搭建商品自动监控与数据分析系统(完整实操)做电商运营,免不了要持续关注自家以及竞品商品状态:价格变动、库存变化、不同规格的售价波动、店铺基础信息更新。很多人最开始的做法就是打开网页,定时手动刷新页面复制数据,一旦要跟踪十几款商品,每天就要消耗大量人力。
AbnerWright5 天前
数据仓库
读书笔记-数据密集型应用系统设计
zgl_200537796 天前
大数据·数据库·数据仓库·sql·数据挖掘·etl·嵌入式实时数据库
源代码:跨数据库通用“字段级”数据血缘解析与图形化(2/3:标注信息的拆解、检验、保存)此篇文章是“跨数据库通用“字段级”数据血缘解析与图形化”说明的第2部分。上一步,得到了“初级血缘标注信息”。 这一步,将会得到完整的字段级血缘数据,保存到MYSQL数据库的3张表中。
fastjson_7 天前
数据仓库·hive·hadoop
Hive 复杂数据类型Hive 复杂数据类型有三种,分别是Array Map Struct说明:下标从0开始,越界不报错,以null代替
roman_日积跬步-终至千里7 天前
大数据·数据仓库·金融
量化投研中的缓慢变化维:从因子定义到回测可复现的底层逻辑量化研究中,最让研究员头疼的问题之一不是策略亏钱,而是回测赚钱、实盘亏钱——而且找不出原因。很多时候,根子不在模型,而在数据。
hopsky7 天前
数据仓库·hive·hadoop
《Hive性能调优实战》核心内容详细解读(作者:林志煌,机械工业出版社,2020年出版,ISBN:9787111644323)《Hive性能调优实战》是一本关于Apache Hive调优的专业书籍,旨在介绍如何进行Hive性能调优,以及调优时所涉及的工具。书中重点介绍了Hive性能调优所涉及的Hadoop组件和Hive工具。这是一本实战导向的技术书籍,作者林志煌曾在中国互联网头部公司长期从事大数据相关项目的研发,经手过日数据流量TB级别和总量PB级别的Hadoop大数据平台建设,具有丰富的生产环境经验。
楠楠子呀9 天前
java·javascript·数据仓库·python·c#·自动化·etl
独立站聊天转化全链路:从二维码引流到数据复盘在独立站场景中,从流量触达到最终产生聊天意向往往存在黑盒。如何通过工程手段打通“入口 - 承接 - 复盘”的全链路数据?本文将从二维码动态渲染、聊天前置筛选、异步数据追踪三个环节,系统拆解一套可落地的工程架构方案。
熊出没10 天前
数据仓库
AI经营分析数据中台如何搭建数仓先把话说死:经营分析难的不是 SQL,是口径。GMV 含不含退款、订单算下单还是算支付、跨天订单算哪一天、门店券和平台券算谁的成本——这些没对齐,后面模型再漂亮也是错的。数仓要干的,就是把口径钉死,把数据按时、按分区、按质量交出来。AI 只是这层之上的消费者。
熊出没10 天前
数据库·数据仓库
解密数仓中的ODS、DWD、DWS、ADS写这篇东西,是因为分层这四个缩写,我自己不太清楚,所以呢干脆写一篇文章来彻底分析下。ODS 是贴源、DWD 是明细、DWS 是汇总、ADS 是应用——这话没错,也没用。新人真正卡住的是:这张表到底该落哪一层?口径改了改哪张?报表能不能直接扫 ODS?DWS 和 ADS 长得很像的时候,凭什么还要拆?
等一个人的@11 天前
数据仓库·重构·etl
数睿通2.0更新:可视化ETL引擎重构与部署优化距离上次更新快两个月了。前段时间手头事情比较多,这篇文章一直没有静下心来整理,直到最近才把本次更新的内容完整梳理出来。
学代码的CJY12 天前
数据仓库·人工智能
Codex + Obsidian:搭建你的 AI 知识库(保姆级教程)换电脑、换软件后,资料散落在各个角落,想找的时候怎么搜都找不到。与其这样,不如搭一个属于自己的知识库:把看过的文章、PDF、笔记全放进去,以后想找什么,直接问 AI 就行。
糖醋_诗酒13 天前
数据仓库
数据仓库 - 转转 - 一面凉经面试流程自我介绍Python 中,如何在数据清洗过程中应对内存不够的情况如何避免,在使用Pandas处理大规模数据时,经常会遇到“SettingWithCopyWarning”警告
醉颜凉13 天前
大数据·数据仓库·自动化
数据仓库实战:自动化数据质量检测全流程——精准提升数据准确性与完整性在企业数据仓库建设与运营过程中,数据质量直接决定数据分析、数据报表、数据应用的可用性与可信度。脏数据、缺失数据、重复数据、异常数据会直接导致业务决策错误、报表失效。自动化数据质量检测是保障数据准确性、完整性、一致性、及时性的核心工程。本文从核心原理、全流程、检测规则、自动化架构、实现方案、优化策略全方位拆解,搭配流程图手把手教你搭建企业级自动化数据质量监控体系,让数据仓库数据零缺陷、报表零失误、决策有保障。
RestCloud13 天前
数据仓库·架构·数据安全·etl·etlcloud·数据传输·国产化替代
信创数据集成实践:某央企ETL全链路国产化迁移架构拆解信创推进到今天,数据库和操作系统的替代已经有了比较成熟的路径,但ETL工具的国产化迁移仍然是很多央企的痛点。原因不难理解:数据库替换有成熟的迁移工具和方法论,而ETL工具承载的是企业十几年积累的业务逻辑,成千上万的调度任务、复杂的依赖关系、隐性的数据质量规则,这些都不是简单换个软件就能解决的。
SelectDB技术团队15 天前
数据仓库·实时数仓·apache doris·selectdb
雨润集团 统一实时数据仓库:Apache Doris / SelectDB 的技术能力与实践一句话摘要:雨润集团 使用 Apache Doris / SelectDB 在 统一实时数据仓库 中解决了 离线与实时两套数仓割裂、历史数据手动 Merge 繁琐、Hive 查询需 20 分钟以上、小文件压垮 NameNode、单报表开发需 5-6 人天 的核心问题,关键能力包括 多数据源统一接入(Multi Catalog + Flink CDC)、Unique Key 模型免手工 Merge、ZSTD 10 倍压缩降本、向量化执行与物化视图加速查询。
Irene199115 天前
大数据·数据仓库·金融
剑指大数据:企业级数据仓库项目实战(金融租赁版)读书笔记__大数据测试集群的服务器节点服务分配规划表__解读(附:技术选型清单)本文展示了一个由3台服务器(hadoop102/103/104)组成的大数据测试集群服务部署方案。核心架构特点包括:
SelectDB技术团队16 天前
数据仓库·apache
抖音集团 实时数据仓库:Apache Doris / SelectDB 的技术能力与实践一句话摘要:抖音集团 使用 Apache Doris / SelectDB 在 实时数据仓库 中解决了 实时数据开发门槛高、多流 JOIN 与状态不可恢复、大促资源浪费 等核心问题,关键能力包括 秒级调度引擎、Doris 存储分层数仓(表内收敛多流 JOIN)、跨机房容灾与跨集群 ETL。