数据分析-TopN数据采集

CREATE TABLE access_log_url_top (

url STRING,

times INT

);

INSERT OVERWRITE TABLE access_log_url_top

SELECT top.url, top.times

FROM (

SELECT url,COUNT(1) AS times

FROM access_log

WHERE INSTR(url,'.mooc') > 0

GROUP BY url

) top

ORDER BY top.times DESC

LIMIT 10;


这段代码是一个 Hive SQL 查询语句,其作用是从名为`access_log`的表中筛选出包含`.mooc`的 URL,并统计每个 URL 的出现次数,然后按照出现次数降序排列,最后取前 10 条结果存入名为`access_log_url_top`的表中。

具体分析如下:

  1. 子查询部分:
  • `SELECT url,COUNT(1) AS times FROM access_log WHERE INSTR(url,'.mooc') > 0 GROUP BY url`:

  • 从`access_log`表中选择`url`列,并使用`COUNT(1)`统计每个`url`的出现次数,将其命名为`times`。

  • `WHERE INSTR(url,'.mooc') > 0`条件用于筛选出`url`中包含`.mooc`的记录。

  • `GROUP BY url`按照`url`进行分组,以便对每个不同的`url`分别统计出现次数。

  1. 外部查询部分:
  • `SELECT top.url, top.times FROM (子查询) top ORDER BY top.times DESC LIMIT 10`:

  • 从子查询结果中选择`url`和`times`列。

  • `ORDER BY top.times DESC`按照`times`列降序排列结果。

  • `LIMIT 10`限制结果集只返回前 10 条记录。

总的来说,这段代码的目的是找出在`access_log`表中出现次数最多的前 10 个包含`.mooc`的 URL,并将其存入新表`access_log_url_top`中。

相关推荐
2201_761040592 分钟前
Golang如何做灰度发布_Golang灰度发布教程【实战】
jvm·数据库·python
小梦爱安全4 分钟前
SQL Server(Linux)安装
数据库·microsoft·sqlserver
baidu_340998829 分钟前
CSS Grid布局如何实现项目在网格内填充_掌握justify-items属性
jvm·数据库·python
2401_8971905514 分钟前
JavaScript中数组洗牌算法Shuffle的随机性优化处理
jvm·数据库·python
不爱写程序的东方不败18 分钟前
MySQL出现慢查询或者主从延迟的问题,怎么做根因分析?
数据库·mysql
Polar__Star25 分钟前
Golang bcrypt如何加密密码_Golang密码加密教程【收藏】
jvm·数据库·python
澄澈青空~1 小时前
有一个叫R2C,也有一个叫G2C
java·数据库·人工智能·c#
weixin_586061461 小时前
如何用 event.composedPath 获取事件触发经过的所有节点
jvm·数据库·python
weixin_408717771 小时前
如何用 Iterator.from 将类数组转化为具备现代方法的迭代器
jvm·数据库·python
努力努力再努力wz1 小时前
【MySQL入门系列】掌握表数据的 CRUD:DML 核心语法与执行逻辑解析
android·开发语言·数据结构·数据库·c++·b树·mysql