数据分析-TopN数据采集

hhXx_琉璃2024-10-25 22:58

CREATE TABLE access_log_url_top (

url STRING,

times INT

);

INSERT OVERWRITE TABLE access_log_url_top

SELECT top.url, top.times

FROM (

SELECT url,COUNT(1) AS times

FROM access_log

WHERE INSTR(url,'.mooc') > 0

GROUP BY url

) top

ORDER BY top.times DESC

LIMIT 10;

这段代码是一个 Hive SQL 查询语句，其作用是从名为`access_log`的表中筛选出包含`.mooc`的 URL，并统计每个 URL 的出现次数，然后按照出现次数降序排列，最后取前 10 条结果存入名为`access_log_url_top`的表中。

具体分析如下：

`SELECT url,COUNT(1) AS times FROM access_log WHERE INSTR(url,'.mooc') > 0 GROUP BY url`：
从`access_log`表中选择`url`列，并使用`COUNT(1)`统计每个`url`的出现次数，将其命名为`times`。
`WHERE INSTR(url,'.mooc') > 0`条件用于筛选出`url`中包含`.mooc`的记录。
`GROUP BY url`按照`url`进行分组，以便对每个不同的`url`分别统计出现次数。

总的来说，这段代码的目的是找出在`access_log`表中出现次数最多的前 10 个包含`.mooc`的 URL，并将其存入新表`access_log_url_top`中。