阅读571 返回首页    go 阿里云 go 技术社区[云栖]


开源大数据周刊-第49期

资讯

技术

  • Apache Spark & Apache Zeppelin的安全状态
    本讲义出自Vinay Shukla在Hadoop Summit Tokyo 2016上的演讲,主要介绍了 Spark的安全体系、以及YARN AM上的Spark驱动以及Kerberos身份验证等相关内容,最后还介绍了SparkSQL的相关内容。

  • Apache Spark常见的三大误解
    Apache Spark常见的三大误解:Spark是一种内存技术、Spark要比Hadoop快10x-100x、Spark在数据处理方面引入了全新的技术。

  • Hadoop NameNode元数据相关文件目录解析
    在第一次部署好Hadoop集群的时候,我们需要在NameNode(NN)节点上格式化磁盘:$HADOOP_HOME/bin/hdfs namenode -format,格式化完成之后,将会在$dfs.namenode.name.dir/current目录下如下的文件...

  • Spark Standalone架构设计要点分析
    Apache Spark是一个开源的通用集群计算系统,它提供了High-level编程API,支持Scala、Java和Python三种编程语言。Spark内核使用Scala语言编写,通过基于Scala的函数式编程特性,在不同的计算层面进行抽象,代码设计非常优秀。

  • Apache Spark 内存管理详解
    Spark 作为一个基于内存的分布式计算引擎,其内存管理模块在整个系统中扮演着非常重要的角色。理解 Spark 内存管理的基本原理,有助于更好地开发 Spark 应用程序和进行性能调优。本文旨在梳理出 Spark 内存管理的脉络,抛砖引玉,引出读者对这个话题的深入探讨。本文中阐述的原理基于 Spark 2.1 版本,阅读本文需要读者有一定的 Spark 和 Java 基础,了解 RDD、Shuffle、JVM 等相关概念。

欢迎加入阿里云开源大数据交流钉钉群

screenshot

国内大数据相关会议

| 会议 | 地点 | 时间 | 费用 |

版权声明

信息都是来自互联网,都给出了原文的链接,如果侵权,请联系我们,我们负责删除。

阿里云E-Mapreduce团队 出品

最后更新:2017-04-21 10:30:30

  上一篇:go 姿势多且很实用——看完这些内容你就能玩转云计算!
  下一篇:go RDS SQL Server死锁(Deadlock)系列之二使用Profiler捕获死锁