大数据发展史

一、hadoop发展史

hadoop创始人Doug Cutting,主要为了实现Google类似全文搜索功能,该功能是基于Lucene框架进行优化升级,索引引擎;

2001年底Lucence成为Apache基金会的一个子项目,当时为了解决存储海量数据困难,检索海量速度慢,可以说Google是hadoop的思想之源;

GFS ---> HDFS

MapReduce ---> MR

BigTable ---> HBase

2006年3月份,MapReduce和Nutch Distributed File System(NDFS)被纳入到Hadoop项目,Hadoop正式诞生;

二、hadoop三大发行版本

Hadoop三大发行版本:Aapche、Cloudera、Hortonworks。

Apache版本最原始(最基础)的版本,对于入门学习最好。

Cloudera内部集成了很多大数据框架,对应产品CDH。

Hortonworks文档较好,对应产品HDP。

Hortonworks现在已经被Cloudera公司收购,推出新的品牌CDP。

三、hadoop优势

1)高可靠性:hadoop底层维护多个数据副本,即使某个计算或者存储出现故障,也不会丢失数据;

2)高扩展:集群可方便的扩展数以千计的节点;

  1. 高效性:在MapReduce下,Hadoop工作是并行的,这样能加速任务的处理速度;

4)高容错性:能够自动将失败的任务重新分配;

相关推荐
TDengine (老段)14 分钟前
TDengine 快速体验(Docker 镜像方式)
大数据·数据库·物联网·docker·时序数据库·tdengine·涛思数据
金融小师妹25 分钟前
解码美元-黄金负相关:LSTM-Attention因果发现与黄金反弹推演
大数据·人工智能·算法
安科瑞刘鸿鹏38 分钟前
双碳时代,能源调度的难题正从“发电侧”转向“企业侧”
大数据·运维·物联网·安全·能源
时序数据说1 小时前
时序数据库IoTDB数据模型建模实例详解
大数据·数据库·开源·时序数据库·iotdb
时序数据说1 小时前
时序数据库IoTDB结合SeaTunnel实现高效数据同步
大数据·数据库·开源·时序数据库·iotdb
代码搬运媛2 小时前
ES Modules 与 CommonJS 的核心区别详解
大数据·elasticsearch·搜索引擎
小王不会写code2 小时前
Hadoop 2.7.7 单机伪分布式安装与配置教程(JDK 8)
java·hadoop·分布式
zh_199953 小时前
Hive面试题汇总
大数据·hive·hadoop·架构·面试题
不爱学英文的码字机器4 小时前
[Git] 标签管理
大数据·git·elasticsearch
Elastic 中国社区官方博客5 小时前
使用 OpenTelemetry 和 Elastic 简化公共部门的可观察性
大数据·elasticsearch·搜索引擎·全文检索·可用性测试·opentelemetry