Hadoop学习--第一章 Hello大数据分布式

第一章 Hello大数据分布式

数据导论

什么是数据?

数据:一种可以被鉴别的对客观事件进行记录的符号。

简单来说就是:对人类的行为及产生的事件的一种记录

数据的价值

对数据的内容进行深入分析,可以更好的帮助了解事和物在现实世界的运行规律

比如,购物的订单记录(数据)可以帮助平台更好的了解消费者,从而促进交易。

大数据技术栈

当下时代已经是数据的时代,数据非常重要并且蕴含巨大的价值。

大数据诞生

大数据的诞生是跟随着互联网的发展的

当全球互联网逐步建成(2000年左右),各大企业或政府单位拥有了海量的数据亟待处理。

基于这个前提逐步诞生了以分布式(以数量战胜数量,多台服务器处理海量数据) 的形式(即多台服务器集群)完成海量数据处理的处理方式,并逐步发展成现代大数据体系。

分布式处理技术

Apache Hadoop

Apache Hadoop对大数据体系的意义

第一款获得业界普遍认可的开源分布式解决方案

让各类企业都有可用的企业级开源分布式解决方案

一定程度上催生出了众多的大数据体系技术栈

从Hadoop开始(2008年左右)大数据开始蓬勃发展

大数据概述

什么是大数据?

大数据特征

从海量的高增长、多类别、低信息密度的数据中挖掘出高质量的结果

大数据核心工作

大数据软件生态

数据存储

数据计算

数据传输

Apache是什么?

Apache(Apache软件基金会)是一个专门为支持开源软件项目而办的非营利性组织,在它所支持的Apache项目与子项目中,所发行的软件产品都遵循Apache许可证(Apache License)。

Apache Hadoop概述

什么是Hadoop?

可以实现大数据核心工作的存储和计算(另一个是传输)

为什么学习Hadoop?

Hadoop的功能

Hadoop发展

Hadoop发行版本

相关推荐
jstart千语5 小时前
【Redis】分布式锁的实现
数据库·redis·分布式
CONTONUE6 小时前
运行Spark程序-在Idea中(二)
大数据·spark·intellij-idea
计算机人哪有不疯的6 小时前
图文展示HDFS、YARN、MapReduce三者关系
大数据·spark
祈5336 小时前
MapReduce 的工作原理
大数据·mapreduce
Agatha方艺璇6 小时前
MapReduce报错 HADOOP_HOME and hadoop.home.dir are unset.
大数据·hadoop·mapreduce
@十八子德月生7 小时前
8天Python从入门到精通【itheima】-1~5
大数据·开发语言·python·学习
元6337 小时前
Hadoop集群的常用命令
大数据·hadoop
掘金-我是哪吒8 小时前
分布式微服务系统架构第125集:AI大模型
分布式
武汉格发Gofartlic9 小时前
FEKO许可证的安全与合规性
大数据·运维·安全
言小乔.9 小时前
202534 | KafKa简介+应用场景+集群搭建+快速入门
分布式·kafka