大数据发展史

jiedaodezhuti2023-10-14 6:09

一、hadoop发展史

hadoop创始人Doug Cutting，主要为了实现Google类似全文搜索功能,该功能是基于Lucene框架进行优化升级,索引引擎;

2001年底Lucence成为Apache基金会的一个子项目,当时为了解决存储海量数据困难,检索海量速度慢,可以说Google是hadoop的思想之源;

GFS ---> HDFS

MapReduce ---> MR

BigTable ---> HBase

2006年3月份,MapReduce和Nutch Distributed File System（NDFS）被纳入到Hadoop项目,Hadoop正式诞生;

二、hadoop三大发行版本

Hadoop三大发行版本:Aapche、Cloudera、Hortonworks。

Apache版本最原始（最基础）的版本，对于入门学习最好。

Cloudera内部集成了很多大数据框架，对应产品CDH。

Hortonworks文档较好，对应产品HDP。

Hortonworks现在已经被Cloudera公司收购，推出新的品牌CDP。

三、hadoop优势

1）高可靠性:hadoop底层维护多个数据副本,即使某个计算或者存储出现故障,也不会丢失数据;

2）高扩展:集群可方便的扩展数以千计的节点;

4）高容错性:能够自动将失败的任务重新分配;