大数据发展史

一、hadoop发展史

hadoop创始人Doug Cutting,主要为了实现Google类似全文搜索功能,该功能是基于Lucene框架进行优化升级,索引引擎;

2001年底Lucence成为Apache基金会的一个子项目,当时为了解决存储海量数据困难,检索海量速度慢,可以说Google是hadoop的思想之源;

GFS ---> HDFS

MapReduce ---> MR

BigTable ---> HBase

2006年3月份,MapReduce和Nutch Distributed File System(NDFS)被纳入到Hadoop项目,Hadoop正式诞生;

二、hadoop三大发行版本

Hadoop三大发行版本:Aapche、Cloudera、Hortonworks。

Apache版本最原始(最基础)的版本,对于入门学习最好。

Cloudera内部集成了很多大数据框架,对应产品CDH。

Hortonworks文档较好,对应产品HDP。

Hortonworks现在已经被Cloudera公司收购,推出新的品牌CDP。

三、hadoop优势

1)高可靠性:hadoop底层维护多个数据副本,即使某个计算或者存储出现故障,也不会丢失数据;

2)高扩展:集群可方便的扩展数以千计的节点;

  1. 高效性:在MapReduce下,Hadoop工作是并行的,这样能加速任务的处理速度;

4)高容错性:能够自动将失败的任务重新分配;

相关推荐
周全全14 分钟前
Elasticsearch 检索优化:停用词的应用
大数据·elasticsearch·jenkins
qt6953188_38 分钟前
把握旅游新契机,开启旅游创业新征程
大数据·创业创新·旅游
码爸1 小时前
flink自定义process,使用状态求历史总和(scala)
大数据·elasticsearch·flink·kafka·scala
传输大咖1 小时前
传输大咖44 | 云计算企业大数据迁移如何更安全高效?
大数据·安全·云计算·数据迁移·企业大文件传输
月亮月亮要去太阳1 小时前
spark-scala使用与安装(一)
大数据·spark·scala
毕设木哥1 小时前
25届计算机专业毕设选题推荐-基于python+Django协调过滤的新闻推荐系统
大数据·服务器·数据库·python·django·毕业设计·课程设计
天冬忘忧2 小时前
DataX--Web:图形化界面简化大数据任务管理
大数据·datax
小宋10212 小时前
高性能分布式搜索引擎Elasticsearch详解
大数据·elasticsearch·搜索引擎
DolphinScheduler社区3 小时前
中电信翼康基于Apache Dolphinscheduler重构“星海·济世医疗数据中台”实践经验分享
大数据
sunxunyong3 小时前
Linux 删除文件不释放空间问题处理
大数据·linux·运维·服务器