作家
登录

大数据系列之并行计算引擎Spark介绍

作者: 来源: 2017-04-24 14:44:07 阅读 我要评论

  •  counts.saveAsTextFile("file:///hadoopLearning/spark-1.5.1-bin-hadoop2.4/countReslut.txt"
  •  
  •  } 
    • 关于RDD的Transformation与Action的特点我们介绍下;

    1.接口定义方法不合:

    1.运行在资本治理体系上,比如Yarn或mesos

    Transformation: RDD[X]–>RDD[y]

    Action:RDD[x]–>Z (Z不是一个RDD,可能是一个根本类型,数组等)

    2.惰性履行:

    Transformation:只会记录RDD转化关系,并不会触发计算

    Action:是触发法度榜样履行(分布式)的算子。

    法度榜样的履行流程:

    4.义务调剂和启动开销大年夜;

    Spark运行模式:

    Local(本地模式):

    1.单机运行,平日用于测试;

    • local:只启动一个executor
    • local[k]:启动k个executor
    • local[*]:启动跟cpu数量雷同的executor

    2.standalone(自力模式)

    自力运行在一个集群中

    3.Yarn/mesos

    yanr-cluster


    两种方法的差别:

    构建于Spark之上的SparkSQL ,应用婷察速以及内存表等优势,承担了日记数据的即席萌芽工作。

    • 典范算法的Spark实现

    猜测用户的告白点击概率;

    1.许可将RDD缓存到内存中或磁盘上,以便于重用

    用于ETL的SparkSQL和DAG义务。

    【编辑推荐】

    1. 助你地点团队走上大年夜数据路途的六大年夜规矩
    2. Spark名词解释及关系
    3. 高可用大年夜数据计算办事若何持续宣布和演进
    4. Spark:超出Hadoop MapReduce
    5. Spark源码分析之分区器的感化
    【义务编辑:武晓燕 TEL:(010)68476606】

      推荐阅读

      数字化为丹东智慧城市腾飞安上羽翼

    第四,要让聪明城市的公平易近经由过程一张“市平易近卡”,融入社会生活并进行社会治理。市平易近卡将是成都聪明城市市平易近为行政办事体系供给同一的身份辨认模式。这张卡功能广泛,集传统的城市通卡、>>>详细阅读


    本文标题:大数据系列之并行计算引擎Spark介绍

    地址:http://www.17bianji.com/lsqh/34921.html

    关键词: 探索发现

    乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

    网友点评
    自媒体专栏

    评论

    热度

    精彩导读
    栏目ID=71的表不存在(操作类型=0)