CREATE TABLE access_log_url_top (
url STRING,
times INT
);
INSERT OVERWRITE TABLE access_log_url_top
SELECT top.url, top.times
FROM (
SELECT url,COUNT(1) AS times
FROM access_log
WHERE INSTR(url,'.mooc') > 0
GROUP BY url
) top
ORDER BY top.times DESC
LIMIT 10;
这段代码是一个 Hive SQL 查询语句,其作用是从名为`access_log`的表中筛选出包含`.mooc`的 URL,并统计每个 URL 的出现次数,然后按照出现次数降序排列,最后取前 10 条结果存入名为`access_log_url_top`的表中。
具体分析如下:
- 子查询部分:
-
`SELECT url,COUNT(1) AS times FROM access_log WHERE INSTR(url,'.mooc') > 0 GROUP BY url`:
-
从`access_log`表中选择`url`列,并使用`COUNT(1)`统计每个`url`的出现次数,将其命名为`times`。
-
`WHERE INSTR(url,'.mooc') > 0`条件用于筛选出`url`中包含`.mooc`的记录。
-
`GROUP BY url`按照`url`进行分组,以便对每个不同的`url`分别统计出现次数。
- 外部查询部分:
-
`SELECT top.url, top.times FROM (子查询) top ORDER BY top.times DESC LIMIT 10`:
-
从子查询结果中选择`url`和`times`列。
-
`ORDER BY top.times DESC`按照`times`列降序排列结果。
-
`LIMIT 10`限制结果集只返回前 10 条记录。
总的来说,这段代码的目的是找出在`access_log`表中出现次数最多的前 10 个包含`.mooc`的 URL,并将其存入新表`access_log_url_top`中。