离线数仓优化简述

本文分享自天翼云开发者社区《离线数仓优化简述》,作者:徐****东

1、业务层面

计算量太大是不是必须的,是否可以减少参与计算的用户量或者时间跨度;

计算逻辑是否过于复杂,是否可以简化。

2、模型层面

是否有现成的数据可以使用或者基于现成的数据进行加工;

是否可以将整个计算逻辑进行合理拆分,降低每个子任务的复杂度,同时提高复用的可能性;

维度退化,空间和时间的权衡。

3、系统层面(遵循一些计算引擎建议的使用规则和参数设置)

使用Spark3引擎,自动合并小文件;

输入文件的存储格式、压缩格式、大小;

输出文件的大小;

启用压缩;

分区、分桶;

拉链表;

yarn队列的设置;

合适的计算引擎;

task的内存设置;

task处理的数据量;

task的数量;

并行度优化;

调整参数减少Map数量;

调整参数减少reduce数量。

4、sql、代码层面

列裁剪,避免select *;

分区裁剪,使用分区字段过滤;

条件限制;

谓词下推;

map端预聚合;

大key的过滤;

打散倾斜key;

合适的join方式;

用Distribute By Rand控制分区中数据量;

group by优化;

中间结果的缓存和复用;

小文件优化。

5、任务层面

减少任务依赖,尽可能缩短链路;

业务链路/逻辑重构/改写;

任务分级,任务数评估,错峰调度;

任务依赖降级,周级别的任务依赖天级别,天级别依赖小时级别,小时级别依赖分钟级别;

避免频繁创建任务;

核心任务优先保证产出,双链路机制开启;

耗时长的任务拆分成子任务。任务批次提交;

资源动态扩容;

资源腾挪调整;

无用任务下线。

相关推荐
Database_Cool_10 小时前
AnalyticDB MySQL vs StarRocks/ByteHouse:云数仓选型指南——全托管 vs 自建方案
数据库·数据仓库·mysql·阿里云
涤生大数据11 小时前
从 ETL 到 Agent:AI数据工程如何搭建企业级“数据工厂“
数据仓库·人工智能·etl
Database_Cool_2 天前
AnalyticDB MySQL vs Hologres:阿里云内部数仓产品如何选——场景化选型指南
数据库·数据仓库·mysql·阿里云
Nefu_lyh2 天前
【Hive】三、Hive 抽样:讲解 Hive 三大抽样方式:分桶抽样、块抽样、随机抽样的原理、语法、性能对比与实战案例
数据仓库·hive·hadoop
段一凡-华北理工大学2 天前
工业领域的Hadoop架构学习~系列文章16:实时流处理架构 - 工业数据的实时动脉
大数据·数据仓库·hadoop·分布式·学习·架构·高炉炼铁
Database_Cool_2 天前
AnalyticDB MySQL vs ClickHouse:OLAP 数据库选型深度对比——谁更适合企业级分析
数据库·数据仓库·mysql·数据分析
真上帝的左手3 天前
19. 大数据- BI 入门-数仓实战1-数据仓库的核心逻辑与落地范式
大数据·数据仓库·bi
Database_Cool_3 天前
AnalyticDB MySQL vs Apache Doris:企业级云数仓如何选型——全维度对比指南
数据库·数据仓库·mysql·阿里云
真上帝的左手3 天前
19. 大数据- BI 入门-数仓实战4-DIM 维度层
大数据·数据仓库·bi
真上帝的左手3 天前
19. 大数据- BI 入门-数仓实战终篇-数据仓库演进对比与深度思考
大数据·数据仓库·bi