SQL进阶技巧:非等值连接--单向近距离匹配

目录

[0 场景描述](#0 场景描述)

[1 数据准备](#1 数据准备)

[2 问题分析](#2 问题分析)

​编辑

​编辑

[3 小结](#3 小结)

数字化建设通关指南


0 场景描述

表 t_1 和表 t_2 通过 a 和 b 关联时,有相等的取相等的值匹配,不相等时每一 个 a 的值在 b 中找差值最小的来匹。

表 t_1:a 中无重复值

表 t_1:a 中无重复值

a 1 2 4 5 8 10

表 t_2:b 中无重复值 b 2 3 7 11 13

问题:单向最近匹配

输出结果如下所示:

注意:b 的值可能会被丢弃

a b

1 2

2 2

4 3

5 3

5 7

8 7

10 11

1 数据准备

sql 复制代码
create table t_1 as
    (select stack(
                    6,
                    1,
                    2,
                    4,
                    5,
                    8,
                    10
            ) as (a));

create table t_2 as
    (select stack(
                    5,
                    2,
                    3,
                    7,
                    11,
                    13
            ) as (b));

2 问题分析

步骤1:自关联,生成全量的数据集。并按照关联的结果集,按照abs(a-b)差值排序。注意差值有可能重复,因而采用dense_rank()

sql 复制代码
select a
     , b
     , abs(a-b) diff
     , dense_rank()  over (partition by a order by abs(a-b) )
from t_1,
     t_2

步骤2:过滤出rn=1 的值则为最终结果

sql 复制代码
select a, b
from (select a
           , b
           , abs(a - b)                                              diff
           , dense_rank() over (partition by a order by abs(a - b) ) rn
      from t_1,
           t_2) t
where rn = 1

3 小结

本文分析了一种非等值连接--单向近距离匹配的方法及技巧、

数字化建设通关指南

专栏原价99,现在活动价39.9,按照阶梯式增长,直到恢复原价

专栏优势:

(1)一次收费持续更新。

(2)实战中总结的SQL技巧,帮助SQLBOY 在SQL语言上有质的飞越,无论你应对业务难题及面试都会游刃有余【全网唯一讲SQL实战技巧,方法独特】

SQL很简单,可你却写不好?每天一点点,收获不止一点点-CSDN博客

(3)实战中数仓建模技巧总结,让你认识不一样的数仓。【数据建模+业务建模,不一样的认知体系】(如果只懂数据建模而不懂业务建模,数仓体系认知是不全面的)

(4)数字化建设当中遇到难题解决思路及问题思考。

我的专栏具体链接如下:

数字化建设通关指南_莫叫石榴姐的博客-CSDN博客

相关推荐
一只大侠的侠2 分钟前
从零搭建车联网数据分析平台:技术架构与实战落地
架构·数据挖掘·数据分析
Aloudata5 分钟前
数据工程新范式:基于 NoETL 语义编织实现自助下钻分析
数据分析·指标平台·数据工程·noetl·语义层
CHrisFC7 分钟前
江苏硕晟 LIMS 系统:加速环境检测机构合规化进程的利器
大数据·人工智能
xiaolyuh1239 分钟前
MySQL MVCC(多版本并发控制)实现机制深度解析
数据库·mysql
xuefeiniao9 分钟前
docker mysql模式sql-mode不生效
sql·mysql·docker
StarRocks_labs12 分钟前
双 11 大促峰值不翻车:淘天集团 Paimon + StarRocks 大规模 OLAP 查询实战与优化
数据库·starrocks·olap·淘宝·paimon
Access开发易登软件13 分钟前
Access 连接 SQL Server:直通查询 vs 链接表 vs ADO,如何选择?
前端·数据库·vba·access·access开发
智能相对论14 分钟前
Hilight开启公测:营销视频的“DeepSeek时刻”,来了
大数据·人工智能·音视频
小魏每天都学习16 分钟前
【sql-网络拓扑-子网划分-控制流图】
数据库·sql·mysql
计算机毕业编程指导师16 分钟前
【Python大数据选题】基于Hadoop+Spark奥运会金牌榜可视化分析系统源码 毕业设计 选题推荐 毕设选题 数据分析 机器学习 数据挖掘
大数据·hadoop·python·计算机·spark·毕业设计·奥运会金牌