数据仓库_LT,留存,回访的设计思路

今天面试问到了一个问题,假设我们的用户信息是天级别统计的,那么如果计算多天的留存与回访就需要扫描多个分区,这样计算资源比较多,如何进行优化。

首先要介绍一下,留存,回访,lt 这3个基本概念

基本概念

n日留存 :n日后是否访问app

n日回访 :n日活是否访问某个业务模块(app中的某一板块,当这个板块为app时,留存==回访),类似于留存

lt : 用户的生命周期,相当于整体的活跃天数。 详细参考 :用户全生命周期价值(LTV)指标如何计算 - 传播蛙

思路

我们需要构建map存储用户的历史活跃天数,然后利用日期作为key进行快速索引

构建历史全量活跃天数表

复制代码
with all_act_tmp as (
	select 
		device_id,
		map('${date}',1) as act_date_map
	from test_dwd.dwd_user_device_active_di
	where date = '${date}'
	
	union all
	select 
		device_id,
		act_date_map
	from test_dwd.user_dwd_device_active_df
	where date = '${date-1}'
)


insert overwrite table test_dwd.user_dwd_device_active_df partition(date='${date}')
select 
	device_id,
	union_map(act_date_map) 
from 	
	all_act_tmp
group by device_id 

计算相关指标

复制代码
select 
	device_id,
	map_keys(act_date_map) as act_date_list
	size(act_date_map) as all_lt_cnt,
	if(act_date_map['${date}']=1,1,0) as is_act,
	if(act_date_map['${date-1}'=1,1,0]) as is_act_1d,
	if(act_date_map['${date-3}'=1,1,0]) as is_act_3d,
	if(act_date_map['${date-7}'=1,1,0]) as is_act_7d,
	...
	size(sub_map(act_date_map,'${date-2}','${date}')) as lt_3d,
	size(sub_map(act_date_map,'${date-6}','${date}')) as lt_7d,
	size(sub_map(act_date_map,'${date-14}','${date}')) as lt_15d
	...	
from 
	test_dwd.user_dwd_device_active_df 

相关功能函数

sub_map 函数 UDF

sub_map(map,start,end,byKey)

  • Returns a sub map from mao, in which key(or value) is between start and end
相关推荐
Data-Miner11 小时前
休闲食品行业数据分析平台建设方案,揭秘增长新引擎!
大数据·数据库·数据分析
KKKlucifer11 小时前
数据分类分级排名解析:三大核心能力决定选型方向
大数据·数据库·分类
2601_9594819211 小时前
CPT Markets:多语言支持的维度拆解
大数据
歪歪歪比巴卜11 小时前
企业新媒体矩阵规模化后的治理结构与数据能力研究(2026)
大数据·矩阵·媒体
河北清兮网络科技11 小时前
深度解析:2026石家庄短视频APP开发真实成本、隐性开销与避坑方案
大数据·小程序·app·短剧app·广告联盟
Lumistory12 小时前
2026年城市照明工程4大核心痛点及解决方案
大数据·数据库
智慧景区与市集主理人12 小时前
巨有科技智慧营销平台|精准破局,解锁景区低成本高效增长模式
大数据·人工智能·科技
2601_9499369612 小时前
高中物理成绩优异,适合报考大数据哪个细分专业?
大数据
财经资讯数据_灵砚智能12 小时前
基于全球经济类多源新闻的NLP情感分析与数据可视化(夜间-次晨)2026年6月8日
大数据·人工智能·python·ai·信息可视化·自然语言处理·灵砚智能
SelectDB技术团队12 小时前
预约发布会|核心产品力首发,如何构建面向 Agent 时代的企业级数据引擎
数据库·数据仓库·人工智能·数据分析·可观测·apache doris·selectdb