Hive的介绍和使用

一、Hive简介

Hive 是一个框架,可以通过编写sql的方式,自动的编译为MR任务的一个工具。

在这个世界上,会写SQL的人远远大于会写java代码的人,所以假如可以将MR通过sql实现,这个将是一个巨大的市场,FaceBook就这么干。(脸书)

在大数据中,发展趋势:所有的技术全部都变为SQL。
1、Hive是一个数据仓库工具

2、可以将数据加载到表中,编写sql进行分析

3、底层依赖Hadoop,所以每一次都需要启动hadoop(hdfs以及yarn)

4、Hive的底层计算框架可以使用MR、也可以使用Spark、TEZ

5、Hive不是数据库,而是一个将MR包了一层壳儿。类似于一个中介。

Hive官网地址:Apache Hive

GitHub地址: GitHub - apache/hive: Apache Hive · GitHub

文档查看地址:https://cwiki.apache.org/confluence/display/Hive/GettingStarted

目前我们可以采用稳定版(realease):4.0.1

Hive天然的就是当做数据仓库使用的。什么是数据仓库?

  • 数据仓库不是某一款存储软件,是面向分析、经过统一清洗整合的数据集 + 整套架构,存储只是它的底座;
  • Oracle 是关系型数据库,可作为小型数仓的承载载体;Hive 是大数据生态下构建分布式数仓的 SQL 查询引擎;
  • 为了高效取用数据,数仓必须做分层设计,这套分层、表结构、维度事实表的设计工作就是数据建模,和实体仓库分区管理逻辑相

二、Hive体系结构图

注意:

  • 包含*的全表查询,比如select * from table 不会生成MapRedcue任务

  • 包含*的limit查询,比如select * from table limit 3 不会生成MapRedcue任务

三、本地模式安装

hive的下载地址(包含历史归档版本):https://archive.apache.org/dist/hive/

选择版本后下载。

相关推荐
APItesterCris4 小时前
告别人工盯品:借助 OpenClaw 搭建商品自动监控与数据分析系统(完整实操)
大数据·数据库·数据仓库·自动化
千里码aicood11 小时前
基于Hadoop的汽车销量分析与可视化
大数据·hadoop·分布式
AbnerWright1 天前
读书笔记-数据密集型应用系统设计
数据仓库
wxchyy2 天前
手把手教你入门云计算(二):这些技术改变了世界,你也能轻松掌握
hadoop·阿里云·docker·云原生·华为云·云计算·运维开发
BD_Marathon2 天前
Hadoop组成
大数据·hadoop·分布式
zgl_200537792 天前
源代码:跨数据库通用“字段级”数据血缘解析与图形化(2/3:标注信息的拆解、检验、保存)
大数据·数据库·数据仓库·sql·数据挖掘·etl·嵌入式实时数据库
邀星月为媒2 天前
正式迁移 Gitee:core-site-hive 与 core-hive-agent 后续更新只认这两个地址
hive·hadoop·gitee
BD_Marathon2 天前
Hadoop常用端口号
java·大数据·hadoop
fastjson_3 天前
Hive 复杂数据类型
数据仓库·hive·hadoop
爱吃面的猫3 天前
大数据Hadoop之——集群环境搭建(了解)
大数据·hadoop·flume