【架构七】Hadoop

什么是Hadoop?

Hadoop是一个存储系统+计算框架的软件大数据处理框架。

Hadoop的核心,说白了就是HDFSMapReduce ,HDFS为海量数据提供了存储,而MapReduce为海量数据提供了计算框架。HBase是一个分布式的、面向列的开源数据库。属于Nosql。

Flink和MapReduce都是用于大数据处理的计算框架,两者的区别?

Flink:是一个分布式计算框架,可以处理海量数据,既可以处理海量数据,也可以做实时流处理。

Flink和MapReduce是两种不同的大数据处理框架。

MapReduce适用于离线批处理任务,具有较高的延迟和较差的迭代计算能力。

Flink是一个流处理框架,适用于实时和近实时数据处理,具有较低的延迟、支持迭代计算和有状态处理等特点。

CDH与Hadoop?

CDH是一个强大的商业版数据中心管理工具。CDH是Hadoop众多分支中的一种,是开源且免费的。

(1)提供了各组能够快速稳定运行的数据计算框架,如Spark;【Apache Spark(通常简称为Spark)是一个开源的大数据处理框架,旨在提供高速、易用和通用的数据处理和分析能力。Spark提供了一个统一的编程模型,支持批处理、流处理、机器学习和图计算等多种数据处理任务。】

(2)使用Apache Impala做为对HDFS、Hbase的高性能SQL查询引擎;【是一个开源的分布式SQL查询引擎,用于在大规模数据集上进行交互式分析和查询。它是为了提供快速的查询性能和低延迟而设计的。】

(3)使用Hive数据仓库工具帮助用户分析数据;【hive是基于Hadoop的一个数据仓库工具,用来进行数据提取、转化、加载,这是一种可以存储、查询和分析存储在Hadoop中的大规模数据的机制。】

(4)提供Hbase分布式列式NoSQL数据库。

相关推荐
AI行业说21 分钟前
誉财自动化YC‑18‑M8045线上模板机:四轴柔性缝制技术如何重塑服装产线
大数据·人工智能·自动化·缝纫机器人·模板机
Freak嵌入式24 分钟前
RP2040 PIO 编程模型与状态机原理:从硬件架构到工作逻辑全解析
java·大数据·开发语言·单片机·嵌入式硬件·硬件架构
王志来1379447300833 分钟前
场景驱动选型:4U工控机箱如何匹配多元化工业需求
大数据·人工智能·python
Java小白笔记1 小时前
Java中大数据实时归集与指标汇总方案
java·大数据·开发语言
天远数科1 小时前
零信任架构实战:基于天远车辆出险记录核验构建自动化信贷网关
运维·人工智能·架构·自动化
CNSSIRD数据库1 小时前
中国企业海关信用数据库
大数据·数据库·数据分析·论文笔记
weixin_750330231 小时前
OPC一人公司技术服务商对比:从单体架构到AI Agent协同的演进
大数据·人工智能·架构
拿本唠嗑AI研究1 小时前
在WSL上安装Rocky Linux的详细步骤
架构
柳叶方舟1 小时前
Nature:AI 第一次把生物学发现做成“假设—实验—数据分析”闭环?
大数据·论文阅读·人工智能·数据分析·健康医疗
码农阿豪1 小时前
Seedance 2.0/2.5 虚拟素材能跨 Key 共用吗?一次讲清 Asset ID、账号隔离与 SaaS 素材架构
java·运维·架构