Hadoop学习--第一章 Hello大数据分布式

第一章 Hello大数据分布式

数据导论

什么是数据?

数据:一种可以被鉴别的对客观事件进行记录的符号。

简单来说就是:对人类的行为及产生的事件的一种记录

数据的价值

对数据的内容进行深入分析,可以更好的帮助了解事和物在现实世界的运行规律

比如,购物的订单记录(数据)可以帮助平台更好的了解消费者,从而促进交易。

大数据技术栈

当下时代已经是数据的时代,数据非常重要并且蕴含巨大的价值。

大数据诞生

大数据的诞生是跟随着互联网的发展的

当全球互联网逐步建成(2000年左右),各大企业或政府单位拥有了海量的数据亟待处理。

基于这个前提逐步诞生了以分布式(以数量战胜数量,多台服务器处理海量数据) 的形式(即多台服务器集群)完成海量数据处理的处理方式,并逐步发展成现代大数据体系。

分布式处理技术

Apache Hadoop

Apache Hadoop对大数据体系的意义

第一款获得业界普遍认可的开源分布式解决方案

让各类企业都有可用的企业级开源分布式解决方案

一定程度上催生出了众多的大数据体系技术栈

从Hadoop开始(2008年左右)大数据开始蓬勃发展

大数据概述

什么是大数据?

大数据特征

从海量的高增长、多类别、低信息密度的数据中挖掘出高质量的结果

大数据核心工作

大数据软件生态

数据存储

数据计算

数据传输

Apache是什么?

Apache(Apache软件基金会)是一个专门为支持开源软件项目而办的非营利性组织,在它所支持的Apache项目与子项目中,所发行的软件产品都遵循Apache许可证(Apache License)。

Apache Hadoop概述

什么是Hadoop?

可以实现大数据核心工作的存储和计算(另一个是传输)

为什么学习Hadoop?

Hadoop的功能

Hadoop发展

Hadoop发行版本

相关推荐
米羊1211 小时前
已有安全措施确认(上)
大数据·网络
人道领域2 小时前
AI抢人大战:谁在收割你的红包
大数据·人工智能·算法
qq_12498707532 小时前
基于Hadoop的信贷风险评估的数据可视化分析与预测系统的设计与实现(源码+论文+部署+安装)
大数据·人工智能·hadoop·分布式·信息可视化·毕业设计·计算机毕业设计
Hello.Reader3 小时前
Flink 使用 Amazon S3 读写、Checkpoint、插件选择与性能优化
大数据·flink
零售ERP菜鸟3 小时前
范式革命:从“信息化”到“数字化”的本质跃迁
大数据·人工智能·职场和发展·创业创新·学习方法·业界资讯
Hello.Reader3 小时前
Flink 对接 Google Cloud Storage(GCS)读写、Checkpoint、插件安装与生产配置指南
大数据·flink
浪子小院4 小时前
ModelEngine 智能体全流程开发实战:从 0 到 1 搭建多协作办公助手
大数据·人工智能
Coder_Boy_5 小时前
基于Spring AI的分布式在线考试系统-事件处理架构实现方案
人工智能·spring boot·分布式·spring
AEIC学术交流中心5 小时前
【快速EI检索 | ACM出版】2026年大数据与智能制造国际学术会议(BDIM 2026)
大数据·制造
wending-Y5 小时前
记录一次排查Flink一直重启的问题
大数据·flink