- 关于RDD的Transformation与Action的特点我们介绍下;
1.接口定义方法不合:
1.运行在资本治理体系上,比如Yarn或mesos
Transformation: RDD[X]–>RDD[y]
Action:RDD[x]–>Z (Z不是一个RDD,可能是一个根本类型,数组等)
2.惰性履行:
Transformation:只会记录RDD转化关系,并不会触发计算
Action:是触发法度榜样履行(分布式)的算子。

法度榜样的履行流程:
4.义务调剂和启动开销大年夜;

Spark运行模式:
Local(本地模式):
1.单机运行,平日用于测试;
- local:只启动一个executor
- local[k]:启动k个executor
- local[*]:启动跟cpu数量雷同的executor
2.standalone(自力模式)
自力运行在一个集群中

3.Yarn/mesos
yanr-cluster

两种方法的差别:

构建于Spark之上的SparkSQL ,应用婷察速以及内存表等优势,承担了日记数据的即席萌芽工作。
- 典范算法的Spark实现
猜测用户的告白点击概率;
1.许可将RDD缓存到内存中或磁盘上,以便于重用
用于ETL的SparkSQL和DAG义务。
【编辑推荐】
- 助你地点团队走上大年夜数据路途的六大年夜规矩
- Spark名词解释及关系
- 高可用大年夜数据计算办事若何持续宣布和演进
- Spark:超出Hadoop MapReduce
- Spark源码分析之分区器的感化
推荐阅读
第四,要让聪明城市的公平易近经由过程一张“市平易近卡”,融入社会生活并进行社会治理。市平易近卡将是成都聪明城市市平易近为行政办事体系供给同一的身份辨认模式。这张卡功能广泛,集传统的城市通卡、>>>详细阅读
本文标题:大数据系列之并行计算引擎Spark介绍
地址:http://www.17bianji.com/lsqh/34921.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示