为什么安装spark要在hadoop集群的基础上安装

 我来答

1个回答

#合辑# 面试问优缺点怎么回答最加分？

中学学霸王
2016-08-12 · TA获得超过158个赞

知道小有建树答主

回答量：394

采纳率：0%

帮助的人：197万

我也去答题访问个人页

关注

展开全部

Spark与Hadoop一样，是一种开源的集群计算环境，但在特定工作负载情况下比Hadoop更高效。Spark采用基于内存的分布式数据集，优化了迭代式的工作负载以及交互式查询。Spark采用Scala语言实现，使用Scala作为应用框架。与Hadoop不同的是，Spark和Scala紧密集成，Scala像管理本地collective对象那样管理分布式数据集。Spark支持分布式数据集上的迭代式任务，实际上它可以在Hadoop文件系统上与Hadoop一起运行，这是由第三方集群框架Mesos实现的。Spark由加州大学伯克利分校开发，用于构建大规模、低延时的数据分析应用。Spark集群计算架构Spark是一种类似于Hadoop的新型集群计算框架。不同的是，Spark用于特定工作负载类型的集群计算，这种计算在多个并行操作之间重用工作数据集（如机器学习算法）。为了优化这种类型的计算，Spark引入基于内存的集群计算，即将数据集缓存在内存中，减少访问延迟。Spark还引入了一个抽象概念，即弹性分布式数据集RDD（resilientdistributeddatasets）。RDD是一个分布在一组节点之间的只读的对象集合。这些集合是弹性的，即能够在部分数据集丢失的情况下重建。重建部分数据集的过程需要一种维护血统（lineage，即重建部分数据集所需的信息，说明数据是根据什么过程产生的）的容错机制支持。一个RDD可以是：（1）一个从文件创建的Scala对象，或（2）一个并行切片（分布在各个节点之间），或（3）从其他RDD转换得来，或（4）改变已有RDD的持久性，如请求将已有RDD缓存在内存中。Spark应用称为driver，实现单个节点或一组节点上的操作。与Hadoop一样，Spark支持单节点和多节点集群。对于多节点操作，Spark依附于Mesos集群管理器。Mesos为分布式应用提供了有效的资源共享和隔离的平台（见图1）。这种配置允许Spark与Hadoop共用一个节点共享池。图1Spark依赖于Mesos集群管理器实现资源共享和隔离Spark编程模型Driver在数据集上执行两种操作：行为（action）和转换（transformation）。action，即在数据集上执行计算，并向driver返回一个值；transformation，即从已有数据集创建新的数据集。例如，执行Reduce操作（使用某个函数）、遍历数据集（即在每个元素上执行一个函数，类似Map操作），属于action；Map操作、Cache操作（即请求新的数据集缓存在内存中），属于transformation。下面我们将简单介绍一下这两种操作的实例。不过首先熟悉一下Scala语言。Scala简介很多著名网站都使用Scala，像Twitter，LinkedIn，及Foursquare（其web应用框架叫Lift）。此外，有证据表明金融机构也对Scala的性能感兴趣（例如使用EDFTrading进行衍生工具定价）。Scala是一种多范式的编程语言，支持命令式、函数式和面向对象的编程范式。从面向对象的角度来看，Scala中的每个值都是一个对象。同理，从函数式编程的角度来看，每个函数也都是一个值。Scala还是一种静态类型语言，其类型系统表达能力强且安全。此外，Scala还是一种虚拟机语言，Scala编译器生成字节码，使用JRE2直接在Java虚拟机（JVM）上运行。这样，Scala可以在几乎任何支持JVM的地方运行（需要增加Scala运行时库），并使用已有的Java库和Java代码。最后，Scala是可扩展的，可以以库的形式轻易无缝地集成到其他语言中去。Scala实例现在我们来看看Scala的几个实例。Scala有自己的解释器，可以交互式地使用它。本文不对Scala语言进行具体论述，可以参考这里。清单1使用解释器快速了解一下Scala语言。启动Scala之后，出现命令提示符，你就可以在交互模式下评估表达式和程序。创建变量有两种方式，一是使用val创建不可变变量（称为单一赋值的变量），二是使用var创建可变变量。如果试图对val变量进行更改，将提示错误。清单1Scala中的变量$scalaWelcometoScalaversion2.8.1.final(OpenJDKClientVM,Java1.6.0_20).Typeinexpressionstohavethemevaluated.Type:helpformoreinformation.scala>vala=1a:Int=1scala>varb=2b:Int=2scala>b=b+ab:Int=3scala>a=26:error:reassignmenttovala=2^接下来，定义一个简单的函数，计算一个Int类型的平方并返回这个值。使用def定义函数，后面紧跟函数名和参数列表。不需要指定返回值，函数本身可以推断出返回值。注意，这与变量赋值操作类似。这里我演示了在3这个对象上执行这个函数，返回一个名为res0的结果变量（该变量是Scala解释器自动创建的）。见清单2。清单2Scala中的函数scala>defsquare(x:Int)=x*xsquare:(x:Int)Intscala>square(3)res0:Int=9scala>square(res0)res1:Int=81接着，我们看看如何在Scala中创建简单的类（见清单3）。定义一个简单的类Dog，接受String类型的参数（相当于构造器）。注意这里类直接接受参数，而不需要在类主体中定义这个类参数。类中只有一个打印该字符串的函数。创建一个类的实例，然后调用这个函数。注意解释器会插入一些竖线，它们不是代码的一部分。清单3Scala中的类scala>classDog(name:String){|defbark()=println(name+"barked")|}definedclassDogscala>valstubby=newDog("Stubby")stubby:Dog=Dog@1dd5a3dscala>stubby.barkStubbybarkedscala>完成工作以后，只需要敲入:quit就可以退出Scala解释器。安装Scala和Spark首先下载和配置Scala。清单4给出了Scala的下载命令，并准备安装。根据Spark文档，这里使用2.8版本。清单4Scala安装$wgetetoScalaversion2.8.1.final(OpenJDKClientVM,Java1.6.0_20).Typeinexpressionstohavethemevaluated.Type:helpformoreinformation.scala>println("Scalaisinstalled!")Scalaisinstalled!scala>:quit$现在可以看到Scala命令提示符了，输入:quit退出。注意Scala在JVM上下文中执行，所以还需要JVM。我用的是Ubuntu，默认自带了OpenJDK。接下来，根据清单6获取最新的Spark框架。清单6下载和安装Spark框架$wgetpile注意这一步需要连接到互联网。完成以后，按照清单7测试一下Spark。这个测试例子运行SparkPi计算pi的估计值（在单位正方形中随机取点）。命令格式是示例程序（spark.examples.SparkPi），加上主机参数（即定义Mesosmaster）。本例实在localhost上运行，因为这是一个单节点集群。注意清单7执行了两个任务，但是它们是顺序执行的（任务0结束后任务1才开始）。

本回答被提问者采纳

已赞过已踩过<

你对这个回答的评价是？
评论收起

1条折叠回答

推荐律师服务：若未解决您的问题，请您详细描述您的问题，通过百度律临进行免费专业咨询

您可能关注的内容

星火编辑器-与千万TapTap用户，分享你的作品

星火编辑器是一款面向普通用户的游戏创作工具，致力于让个人开发者也能轻松做游戏。点击了解，如何从0开始掌握星火编辑器。

sce.taptap.cn广告

spark hadoop区别_Kimi-AI写作-20W超长文本处理

spark hadoop区别_选Kimi无广告无会员_免登录就能用!AI智能写作、文案、翻译、编程、全能工具，能搜能聊，尽在Kimi~

kimi.moonshot.cn广告

为什么安装spark要在hadoop集群的基础上安装

您可能关注的内容

其他类似问题

为你推荐：