Doris 窗口函数之 LEAD 最佳实践

概念说明

LEAD 是Doris的一个分析窗口函数,用于访问当前行之后的行数据,而无需进行自连接。可以获取分区内当前行之后的第N行的值。

语法

LEAD ( <expr> , \ \[ , \ ] )

参数

|---------|------------------|
| 参数 | 说明 |
| expr | 需要获取值的表达式 |
| offset | 向后偏移的行数 |
| default | 当偏移超出窗口范围时返回的默认值 |

返回

返回与输入表达式相同的数据类型。

需求实践

需求分析

在线客服系统中,求每个最后接待客服的三天解决率,指标定义为

分子:同一个访客三天内未重复来访(不限客服),则标记为已解决,否则为未解决;

分母:人工会话数

分析需求可知,要想实现该需求,需要将会话记录按照时间升序排序,计算访客A来访之后的三天内是否有重复来访记录,如果有记录,则上一次会话记录标记为未解决。

访客可以重复来访多次,因此可抽象成访客A的数据按照时间排序,最后一条数据为已解决,之前间隔超过三天的为已解决,否则为未解决。

需求实现

数据来源

ElasticSearch 已经有现成的会话记录表,`session_info_2026-01` ,相关字段数据格式如下:

|-----------|------------------------------|
| 字段 | 含义 |
| sessionId | 会话ID,表的主键 |
| visitorId | 访客ID |
| startTime | 会话开始时间,13位long类型,这里未存为date类型 |
| staffId | 客服ID |

实现步骤

1.连接Doris客户端,创建ElasticSearch的Catalog

CREATE CATALOG es_catalog PROPERTIES (

"type"="es",

"hosts"="http://ip:9200",

"mapping_es_id"="true",

"doc_value_scan" = "true",

"metadata_refresh_interval_sec"="20"

);

  1. 利用lead 函数构建查询获取同一访客人工会话,每一条数据的对应的下一条数据的会话建立时间。
sql 复制代码
   SELECT 
   sessionId,
   staffId,
   visitorId,
   startTime,
   FROM_UNIXTIME(startTime/1000) startT,
   FROM_UNIXTIME(LEAD(startTime,1,NULL) OVER (PARTITION BY visitorId order by startTime)/1000) AS nextStartT
   FROM es_catalog.default_db.`session_info_2026-01`
   WHERE humanSession=1

查询结果为

  1. 使用case when 为每一条数据打标记,判断是否已解决;
sql 复制代码
 SELECT 
 *,
 (CASE WHEN nextStartT IS NULL THEN 1
  WHEN TIMESTAMPDIFF(HOUR,startT,nextStartT)>72 THEN 1 ELSE 0 END) AS resolved
  FROM (
   SELECT 
   sessionId,
   staffId,
   visitorId,
   startTime,
   FROM_UNIXTIME(startTime/1000) startT,
   FROM_UNIXTIME(LEAD(startTime,1,NULL) OVER (PARTITION BY visitorId order by startTime)/1000) AS nextStartT
   FROM es_catalog.default_db.`session_info_2026-01`
   WHERE humanSession=1
   order by visitorId,startTime
  ) AS t1

查询结果

  1. 统计最终结果,求三天解决率
sql 复制代码
SELECT 
staffId `客服ID`,
COUNT(sessionId) `总会话数`,
SUM(resolved) `已解决会话数`,
COUNT(sessionId)-SUM(resolved) AS `未解决会话数`,
ROUND(SUM(resolved)/COUNT(sessionId)*100,2) AS `三天解决率%`
FROM (
 SELECT 
 *,
 (CASE WHEN nextStartT IS NULL THEN 1
  WHEN TIMESTAMPDIFF(HOUR,startT,nextStartT)>72 THEN 1 ELSE 0 END) AS resolved
  FROM (
   SELECT 
   sessionId,
   staffId,
   visitorId,
   startTime,
   FROM_UNIXTIME(startTime/1000) startT,
   FROM_UNIXTIME(LEAD(startTime,1,NULL) OVER (PARTITION BY visitorId order by startTime)/1000) AS nextStartT
   FROM es_catalog.default_db.`session_info_2026-01`
   WHERE humanSession=1
   order by visitorId,startTime
  ) AS t1
 ) AS t2
GROUP BY staffId
ORDER BY `三天解决率%` ASC

查询结果为

相关推荐
IT研究室5 小时前
最新大数据毕业设计选题推荐-基于大数据的人工智能社交媒体情绪分析与可视化的设计与实现-大数据-Spark-Hadoop-Bigdata
大数据·人工智能·课程设计
Data-Miner5 小时前
离线AI制表:模型适配与脚本固化实操
大数据·数据库·人工智能·excel
梦想画家5 小时前
SQLMesh 告警实战:只用 YAML 配置和 SQL 模型,搭一套数据管道告警
大数据·数据开发·sqlmesh
2501_933670795 小时前
2027届数学与应用数学转经营分析:SQL、财务指标与业务指标补齐路线
数据库·sql·数学建模
段一凡-华北理工大学6 小时前
高炉炼铁机器视觉与智能识别十八讲~系列文章05:炉顶料面识别:装料分布判读与布料制度优化
大数据·人工智能·机器视觉·工业智能化·高炉炼铁智能化·高炉炉顶料面识别
sbjdhjd6 小时前
智能体开始“动手”之后:OpenAI越权事件、Anthropic算力资本化与开放权重模型竞逐 | AI与SI行业日报整理(9月29日—10月6日)
大数据·人工智能·经验分享·笔记·ai·chatgpt·开源
2601_962780916 小时前
数学与应用数学投递供应链计划岗,短板补齐与项目搭建方案
大数据
品牌常新6 小时前
GEO哪家好?2026年服务商选型与能力对比
大数据·人工智能
keke.shengfengpolang6 小时前
2027届数学专业转策略产品助理:从指标拆解到AB实验的知识补齐路径
大数据
ly76896 小时前
Elasticsearch 写入链路的 refresh、flush 与 translog 边界:为什么 bulk 吞吐会突然塌陷
大数据·elasticsearch·搜索引擎·translog·写入链路·bulk调优