Hadoop学习--第一章 Hello大数据分布式

第一章 Hello大数据分布式

数据导论

什么是数据?

数据:一种可以被鉴别的对客观事件进行记录的符号。

简单来说就是:对人类的行为及产生的事件的一种记录

数据的价值

对数据的内容进行深入分析,可以更好的帮助了解事和物在现实世界的运行规律

比如,购物的订单记录(数据)可以帮助平台更好的了解消费者,从而促进交易。

大数据技术栈

当下时代已经是数据的时代,数据非常重要并且蕴含巨大的价值。

大数据诞生

大数据的诞生是跟随着互联网的发展的

当全球互联网逐步建成(2000年左右),各大企业或政府单位拥有了海量的数据亟待处理。

基于这个前提逐步诞生了以分布式(以数量战胜数量,多台服务器处理海量数据) 的形式(即多台服务器集群)完成海量数据处理的处理方式,并逐步发展成现代大数据体系。

分布式处理技术

Apache Hadoop

Apache Hadoop对大数据体系的意义

第一款获得业界普遍认可的开源分布式解决方案

让各类企业都有可用的企业级开源分布式解决方案

一定程度上催生出了众多的大数据体系技术栈

从Hadoop开始(2008年左右)大数据开始蓬勃发展

大数据概述

什么是大数据?

大数据特征

从海量的高增长、多类别、低信息密度的数据中挖掘出高质量的结果

大数据核心工作

大数据软件生态

数据存储

数据计算

数据传输

Apache是什么?

Apache(Apache软件基金会)是一个专门为支持开源软件项目而办的非营利性组织,在它所支持的Apache项目与子项目中,所发行的软件产品都遵循Apache许可证(Apache License)。

Apache Hadoop概述

什么是Hadoop?

可以实现大数据核心工作的存储和计算(另一个是传输)

为什么学习Hadoop?

Hadoop的功能

Hadoop发展

Hadoop发行版本

相关推荐
Elastic 中国社区官方博客8 小时前
Elasticsearch:上下文工程 vs. 提示词工程
大数据·数据库·人工智能·elasticsearch·搜索引擎·ai·全文检索
2501_933329558 小时前
Infoseek舆情系统:企业级数字公关AI中台技术解析
大数据·数据挖掘
2501_933670799 小时前
2026高职大数据与财务管理专业证书报考条件
大数据
weilaikeqi11119 小时前
2026年房产中介怎么选房源管理系统?
大数据
Hello.Reader9 小时前
Flink Standalone 本地一键起集群、Session/Application 两种模式、HA 高可用与排障清单
大数据·flink
月初,9 小时前
Git 常用操作大全(超详细教程)一文教会你完全使用Git
大数据·git·elasticsearch
清 晨10 小时前
TikTok Shop 跨境卖家最新合规与增长应对:从“内容冲量”升级为“商品与履约可控”
大数据·人工智能·跨境电商·tiktok·营销策略
3分钟秒懂大数据11 小时前
实时数仓实战篇一:长周期去重指标建设
大数据·数据仓库·面试·性能优化·flink
蓝眸少年CY11 小时前
什么是Hadoop
大数据·hadoop·分布式
不做码农好多年,该何去何从。11 小时前
zookeeper是什么可以做什么?
分布式·zookeeper·云原生