数据分析-TopN数据采集

CREATE TABLE access_log_url_top (

url STRING,

times INT

);

INSERT OVERWRITE TABLE access_log_url_top

SELECT top.url, top.times

FROM (

SELECT url,COUNT(1) AS times

FROM access_log

WHERE INSTR(url,'.mooc') > 0

GROUP BY url

) top

ORDER BY top.times DESC

LIMIT 10;


这段代码是一个 Hive SQL 查询语句,其作用是从名为`access_log`的表中筛选出包含`.mooc`的 URL,并统计每个 URL 的出现次数,然后按照出现次数降序排列,最后取前 10 条结果存入名为`access_log_url_top`的表中。

具体分析如下:

  1. 子查询部分:
  • `SELECT url,COUNT(1) AS times FROM access_log WHERE INSTR(url,'.mooc') > 0 GROUP BY url`:

  • 从`access_log`表中选择`url`列,并使用`COUNT(1)`统计每个`url`的出现次数,将其命名为`times`。

  • `WHERE INSTR(url,'.mooc') > 0`条件用于筛选出`url`中包含`.mooc`的记录。

  • `GROUP BY url`按照`url`进行分组,以便对每个不同的`url`分别统计出现次数。

  1. 外部查询部分:
  • `SELECT top.url, top.times FROM (子查询) top ORDER BY top.times DESC LIMIT 10`:

  • 从子查询结果中选择`url`和`times`列。

  • `ORDER BY top.times DESC`按照`times`列降序排列结果。

  • `LIMIT 10`限制结果集只返回前 10 条记录。

总的来说,这段代码的目的是找出在`access_log`表中出现次数最多的前 10 个包含`.mooc`的 URL,并将其存入新表`access_log_url_top`中。

相关推荐
清风6666663 小时前
基于单片机的水塔液位检测与智能调节报警系统设计
数据库·单片机·嵌入式硬件·毕业设计·课程设计·期末大作业
gplitems1234 小时前
Technox – IT Solutions & Services WordPress Theme: A Practical
linux·服务器·数据库
不剪发的Tony老师4 小时前
MySQL 9.5创新版发布,有哪些新功能?
数据库·mysql
布朗克1685 小时前
MySQL 及 SQL 注入详细说明
数据库·sql·mysql·1024程序员节
武子康5 小时前
Java-154 深入浅出 MongoDB 用Java访问 MongoDB 数据库 从环境搭建到CRUD完整示例
java·数据库·分布式·sql·mongodb·性能优化·nosql
Austindatabases6 小时前
DBA 从“修电脑的” 到 上演一套 “数据治理” 大戏 --- 维护DBA生存空间,体现个体价值
数据库·dba
LB21126 小时前
Redis黑马点评 day01
数据库·redis·缓存
白小筠6 小时前
创建Django项目
数据库·django·sqlite
扑克中的黑桃A7 小时前
金仓多模数据库平替MongoDB的电子证照国产化实践——从2TB数据迁移到1600+并发支撑
数据库
计算机毕业设计小帅8 小时前
【2026计算机毕业设计】基于Django的社区婴幼儿预防接种系统
数据库·django·课程设计