1. Hadoop是什么

Hadoop发展历史

2003-2004年，Google公开了部分GFS和MapReduce思想的细节，以此为基础Doug Cutting等人用了2年业余时间实现了DFS和MapReduce机制，使Nutch性能飙升；
2005 年Hadoop 作为Lucene的子项目Nutch的一部分正式引入Apache基金会；
2006 年3 月份，Map-Reduce和Nutch Distributed File System （NDFS）分别被纳入到Hadoop 项目中，Hadoop就此正式诞生，标志着大数据时代来临；
名字来源于Doug Cutting儿子的玩具大象；

Hadoop 三大发行版本：Apache、Cloudera、Hortonworks。

Apache 版本最原始（最基础）的版本，对于入门学习最好。2006
Cloudera 内部集成了很多大数据框架，对应产品CDH。2008
- 2008年成立的 Cloudera是最早将 Hadoop商用的公司，为合作伙伴提供 Hadoop的商用解决方案，主要是包括支持、咨询服务、培训。
- 2009年 Hadoop的创始人 Doug Cutting也加盟 Cloudera公司。 Cloudera产品主要为 CDH Cloudera Manager Cloudera Support
- CDH是 Cloudera的 Hadoop发行版，完全开源，比 Apache Hadoop在兼容性，安全性，稳定性上有所增强。 Cloudera的标价为每年每个节点 10000美元。
- Cloudera Manager是集群的软件分发及管理监控平台，可以在几个小时内部署好一个 Hadoop集群，并对集群的节点及服务进行实时监控。
Hortonworks 文档较好，对应产品HDP。2011
- 2011年成立的 Hortonworks是雅虎与硅谷风投公司 Benchmark Capital合资组建。
- 公司成立之初就吸纳了大约 25名至 30名专门研究 Hadoop的雅虎工程师，上述工程师均在 2005年开始协助雅虎开发 Hadoop，贡献了 Hadoop80%的代码。
- Hortonworks的主打产品是 Hortonworks Data Platform HDP），也同样是 100%开源的产品， HDP除常见的项目外还包括了 Ambari，一款开源的安装和管理系统。
- 2018年 Hortonworks目前已经被 Cloudera公司收购。

Hadoop Distributed File System，简称HDFS，是一个分布式文件系统。

NameNode（nn）：存储文件的元数据，如文件名，文件目录结构，文件属性（生成时间、副本数、文件权限），以及每个文件的块列表和块所在的DataNode等。
DataNode(dn)：在本地文件系统存储文件块数据，以及块数据的校验和。
Secondary NameNode(2nn)：每隔一段时间对NameNode元数据备份。

Yet Another Resource Negotiator 简称YARN ，另一种资源协调者，是Hadoop 的资源管理器。

MapReduce 将计算过程分为两个阶段：Map 和Reduce