数据分析-TopN数据采集

CREATE TABLE access_log_url_top (

url STRING,

times INT

);

INSERT OVERWRITE TABLE access_log_url_top

SELECT top.url, top.times

FROM (

SELECT url,COUNT(1) AS times

FROM access_log

WHERE INSTR(url,'.mooc') > 0

GROUP BY url

) top

ORDER BY top.times DESC

LIMIT 10;


这段代码是一个 Hive SQL 查询语句,其作用是从名为`access_log`的表中筛选出包含`.mooc`的 URL,并统计每个 URL 的出现次数,然后按照出现次数降序排列,最后取前 10 条结果存入名为`access_log_url_top`的表中。

具体分析如下:

  1. 子查询部分:
  • `SELECT url,COUNT(1) AS times FROM access_log WHERE INSTR(url,'.mooc') > 0 GROUP BY url`:

  • 从`access_log`表中选择`url`列,并使用`COUNT(1)`统计每个`url`的出现次数,将其命名为`times`。

  • `WHERE INSTR(url,'.mooc') > 0`条件用于筛选出`url`中包含`.mooc`的记录。

  • `GROUP BY url`按照`url`进行分组,以便对每个不同的`url`分别统计出现次数。

  1. 外部查询部分:
  • `SELECT top.url, top.times FROM (子查询) top ORDER BY top.times DESC LIMIT 10`:

  • 从子查询结果中选择`url`和`times`列。

  • `ORDER BY top.times DESC`按照`times`列降序排列结果。

  • `LIMIT 10`限制结果集只返回前 10 条记录。

总的来说,这段代码的目的是找出在`access_log`表中出现次数最多的前 10 个包含`.mooc`的 URL,并将其存入新表`access_log_url_top`中。

相关推荐
excel11 分钟前
prisma 如何处理数据库竞态
前端·数据库·后端
知行产研38 分钟前
易控智驾:毛利率跃升17.2个百分点,矿山无人驾驶从“规模换增长“迈入“盈利拐点“
数据库·mysql
千里码aicood1 小时前
基于CART算法的图书分类系统设计与实现
数据库·算法·分类
饺子大魔王的男人1 小时前
Redis 内存和连接异常怎么排查?用 redis_exporter 搭一套可远程抓取的监控链路
数据库·redis·bootstrap
可涵不会debug1 小时前
第一次学 LangGraph:用一个快递案例搞懂 State、Node、Edge 和 compile
服务器·数据库·mysql
IvorySQL2 小时前
PostgreSQL 日报 |RLS 机密性绕过漏洞(9 月 27 日)
数据库·postgresql
夕除2 小时前
redis--RDB AOF
数据库·redis·缓存
数据工匠老o3 小时前
"能用应用层解决的不用存储过程",十年数据库经验总结
数据库·架构
AC赳赳老秦3 小时前
公开音频转写信息提取:OpenClaw 处理发布会与听证会文本并提取核心决策信息
大数据·开发语言·汇编·数据库·人工智能·deepseek·openclaw
老纪的技术唠嗑局3 小时前
异步索引特性解析:OceanBase 如何提升持续写入场景下的索引检索性能
数据库