作家
登录

Apache Hadoop 3.0.0 GA版正式发布,可以部署到线上

作者: 来源: 2017-12-18 09:20:20 阅读 我要评论

开辟者大年夜赛路演 | 12月16日,技巧立异,北京不见不散

在此之前,多个Hadoop办事的默认端口都属于Linux的临时端口范围(32768-61000)。这就意味着我们的办事在启动的时刻可能因为和其他应用法度榜样产生端口才突而无法启动。如今这些可能会产生冲突的端口已经不再属于临时端口典范围,这些端口的改变会影响NameNode, Secondary NameNode, DataNode以及KMS。与此同时,官方文档也进行了响应的改变,具体可以拜见 HDFS-9427以及HADOOP-12811。下面表格列出了端口变更的情况

\

日前Apache Hadoop 3.0.0 GA 版本正式宣布,这意味着我们就可以正式在线上应用 Hadoop 3.0.0 了!这个版本是 Apache Hadoop 3.0.0 的第一个稳定版本,有很多重大年夜的改进,比如支撑 EC、支撑多于2个的NameNodes、Intra-datanode均衡器等等。下面是关于 Apache Hadoop 3.0.0 GA 的┞俘式介绍。

\

Java最低版本请求大年夜Java7 更改成Java8

所有的Hadoop JARs都是针对Java 8 编译的。仍在应用Java 7 或更低版本的用户必须进级至Java 8。

HDFS支撑纠删码(Erasure Coding)

1.4 倍的空间开销;然而HDFS副本则会有3倍的空间开销。因为纠删码额外开销主如果在重建和履行长途读,它传统用于存储冷数据,即不经常拜访的数据。当安排这个新特点时用户应当推敲纠山步就逮络和CPU 开销。更多关于HDFS的纠删码可以拜见http://hadoop.apache.org/docs/r3.0.0-beta1/hadoop-project-dist/hadoop-hdfs/HDFSErasureCoding.html 。

YARN Timeline Service v.2

YARN 资本模型(YARN resource model)已被推广为支撑用户自定义的可数资本类型(support user-defined countable resource types),不仅仅支撑 CPU 和内存。比如集群治理员可以定义诸如 GPUs、软件许可证(software licenses)或本地附加存储器(locally-attached storage)之类的资本。YARN 义务可以根据这些资本的可用性进行调剂。

本版本惹人了Yarn时光抽办事v.2,重要用于解决2大年夜挑衅:改良时光轴办事的可伸缩性和靠得住性,经由过程惹人流和聚合加强可用性。

Shell脚本重写

Hadoop的Shell脚本被重写解决了之前很多经久存在的bug,并且惹人了一些新的特点。绝大年夜部分都保持兼容性,不过如有些变更可能使得现有的安装不克不及正常运行。不兼容的改变可以拜见HADOOP-9902。更多内容请拜见Unix Shell Guide文档。即使你是资深用户,也建议看下这个文档,因为其描述了很多新的功能,特别是与可扩大性有关的功能。

YARN Timeline Service v.2 alpha 1可以让用户和开辟者测试以及反馈,以便使得它可声调换如今的Timeline Service v.1.x。请在测试情况中应用。更多关于YARN Timeline Service v.2的常识请拜见http://hadoop.apache.org/docs/r3.0.0-beta1/hadoop-yarn/hadoop-yarn-site/TimelineServiceV2.html

Shaded client jars

在 Hadoop 2.x 版本,hadoop-client Maven artifact将 Hadoop 所有的依附都加到 Hadoop 应用法度榜样的情况变量中,如许会可能会导致应用法度榜样依附的类和 Hadoop 依附的类有冲突。这个问题在 HADOOP-11804 获得懂得决。

支撑 Opportunistic Containers 和分布式调剂

Opportunistic Container惹人新 Opportunistic 类型的 Container 后,这种 Container 可以应用节点上已分派但未真正应用的资本。原有 Container 类型定义为 Guaranteed 类型。相对于 Guaranteed 类型Container, Opportunistic 类型的Container优先级更低。

MapReduce义务级本地优化

MapReduce添加了Map输出collector的本地实现。对于shuffle密集型的功课来说,这将会有30%以上的机能晋升。更多内容请拜见 MAPREDUCE-2841

支撑多于2个的NameNodes

最初的HDFS NameNode high-availability实现仅仅供给了一个active NameNode和一个Standby NameNode;并且经由过程将编辑日记复制到三个JournalNodes上,这种架构可以或许容忍体系中的任何一个节点的掉败。然而,一些安排须要更高的容错度。我们可以经由过程这个新特点来实现,其许可用户运行多个Standby NameNode。比如经由过程设备三个NameNode和五个JournalNodes,这个体系可以容忍2个节点的故障,而不是仅仅一个节点。HDFS high-availability文档已经对这些信息进行了更新,我们可以浏览这篇文档懂得若何设备多于2个NameNodes。

多个办事的默认端口被改变

支撑Microsoft Azure Data Lake filesystem连接器

Hadoop如今支撑集成Microsoft Azure Data Lake,并作为替代Hadoop默惹9依υ?件体系。

Intra-datanode均衡器

一个DataNode可以治理多个磁盘,正常写入操作,各磁盘会被平均填满。然而,当添加或调换磁盘时可能导致此DataNode内部的磁盘存储的数据严重内斜。这种情况现有的HDFS balancer是无法处理的。这种情况是由新intra-DataNode均衡功能来处理,经由过程hdfs diskbalancer CLI来调用。更多请参考HDFS Commands Guide

重写守护过程以及义务的堆内存治理

Hadoop守护过程和MapReduce义务的堆内存治理产生了一系列变更。

  • HADOOP-10950:介绍了设备守护集成heap大年夜小的新办法。主机内存大年夜小可以主动调剂,HADOOP_HEAPSIZE 已弃用。
  • MAPREDUCE-5785:map和reduce task堆大年夜小的设备办法,所需的堆大年夜小不再须要经由过程义务设备和Java选项实现。已经指定的现有设备不受此更改影响。
  • S3Guard:S3A文件体系客户机的一致性和元数据缓存

      推荐阅读

      2017 Android和iOS频频被曝Bug,它们都怎么了?

    固然很多采取 Android 体系的厂商还未更新 8.0 体系,但谷歌已经开端为自家支撑的 Pixel 设备推送最新的 Android 8.1 了。上周,Android 8.1 体系方才在谷歌 Pixel 设备上推送宣布。但随后用户就发清楚明了 Android>>>详细阅读


    本文标题:Apache Hadoop 3.0.0 GA版正式发布,可以部署到线上

    地址:http://www.17bianji.com/lsqh/39846.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)