阅读89 返回首页    go 阿里云 go 技术社区[云栖]


Hadoop 2.x (一)

1、三大马车

MapReduce ,离线计算框架。对海量数据进行处理,支持分布式,大数据分为小数据集,小数据集进行处理(Map),合并统计数据结果(Reduce)。仅适合离线批处理,很好的容错和扩展,适合简单批处理。

HDFS,分布式文件系统,存储海量数据,分布式,保证数据安全性。主节点保存着文件的元数据,存在内存中,用java写的,同时本地有备份。从节点以块为单位,保存数据及数据校验和

HBase,存储数据的数据库

YARN,分布式,资源管理框架 ,管理集群硬件等信息,主从,每个节点都有一个yarn的资源子节点,给主节点提供信息,字节点要向主节点申请资源,container。

2、Hadoop 2.x生态搭建

最后更新:2017-05-22 23:31:34

  上一篇:go  手把手教你如何在ECS上部署Oracle RAC
  下一篇:go  .xin 域名信用验证问题集锦