大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比

简介: 大数据-80 Spark 简要概述 系统架构 部署模式 与Hadoop MapReduce对比

点一下关注吧!!!非常感谢!!持续更新!!!

目前已经更新到了:

Hadoop(已更完)

HDFS(已更完)

MapReduce(已更完)

Hive(已更完)

Flume(已更完)

Sqoop(已更完)

Zookeeper(已更完)

HBase(已更完)

Redis (已更完)

Kafka(已更完)

Spark(新开的坑!正在更新!)

章节内容

上节我们完成了如下的内容:


Kafka集群监控方案

JConsole

Kafka Eagle

JavaAPI获取集群指标

简单介绍

在技术的不断迭代中,一路发展,三代技术引擎:

  • MapReduce 昨天
  • Spark 今天
  • Flink 未来

MapReduceSpark都是类MR的处理引擎,底层原理非常相似。

什么是Spark

Spark的发展历程如下图: Spark特点

速度快,与MapReduce相比,Spark基于内存运算要快100倍以上,基于硬盘运算也要快10倍以上。Spark实现了高效的DAG执行引擎,可以通过基于内存来高效的处理流数据

使用简单,Spark支持Scala、Java、Python、R的API,还支持超过80种算法,使用户可以快速构建不同的应用。而且Spark支持交互式的Python和Scala的Shell,可以非常方便的在这些Shell中使用Spark集群来验证解决问题的方法

通用性好,Spark提供了统一的解决方案,Spark可以用于批处理、交互式查询(SparkSQL)、实时流处理(SparkStreaming)、机器学习(SparkMLlib)和图计算(GraphX)。这些不同类型的处理都可以在同一个应用中无缝衔接。Spark统一解决方案非常具有吸引力,企业想用统一的平台去处理遇到的问题,减少开发和维护人力的成本和部署平台的物力成本。

兼容性好,Spark可以非常方便的和其他开源的产品进行融合,Spark可以使用YARN、Mesos作为它的资源管理和调度器。可以处理所有Hadoop支持的数据,包括HDFS、HBase、Cassandra等。这对于已经部署Hadoop集群的用户特别重要,因为不需要任何的数据迁移就可以使用Spark。Spark也可以不依赖于其它第三方的资源管理和调度器,它实现了Standalone作为其内置的资源管理和调度框架,这样进一步降低了Spark的使用门槛,使得所有人可以非常容器的部署和使用Spark。

Spark与Hadoop

狭义上

从狭义上看:Hadoop是一个分布式框架,由存储、资源调度、计算三部分组成

Spark是一个分布式计算引擎,是由Scala编写的计算框架,基于内存的快速、通用、可扩展的大数据分析引擎。


广义上

从广义上看:Spark是Hadoop生态中不可或缺的一部分。


MapReduce不足

表达能力有限

磁盘IO开销大

延迟高:任务之间有IO开销,在前一个任务完成之前,另一个任务无法开始。

相对于Spark,Spark的设计要更高效,Spark在借鉴MapReduce优点的同时,很好的解决了MapReduce所面临的问题:

两者对比

Spark的计算模式也属于MapReduce,是对MR框架的优化。


数据存储结构:MapReduce是磁盘HDFS,Spark是内存构建的弹性分布式数据集RDD

编程范式:Map+Reduce表达力欠缺,Spark提供了丰富操作使数据处理代码很短

运行速度:MapReduce计算中间结果存磁盘,Spark中间结果在内存中

任务速度:MapReduce任务以进程,需要数秒启动,Spark是小数据集读取在亚秒级

实际应用

批量处理(离线处理):通常时间跨度在分钟到小时

交互式查询:通常时间跨度在十秒到数十分钟

流处理(实时处理):通常跨度在数百毫秒到数秒

在面对上述的三个场景中,我们通常的解决方案是:


MapReduce

Hive

Impala 或 Storm

但是对应的也带来一些新的问题:


不同场景之间输入输出数据无法做到无缝共享,通常需要进行数据格式的转换、

不同的软件需要不同的开发和维护团队,带来了较高的维护和使用成本

比较难以通一个集群中的各个系统进行统一的资源协调和分配

系统架构

Spark运行包括如下:


Cluster Manager

Worker Node

Driver

Executor

ClusterManager

ClusterManager 是集群资源的管理者,Spark支持3中集群部署模式:


Standalone

YARN

Mesos

WorkerNode

WorkerNode是工作节点,负责管理本地资源。


Driver Program

运行应用的 main() 方法并且创建了 SparkContext。由ClusterManager分配资源,SparkContext发送Task到Executor上执行。


Executor

Executor在工作节点上运行,执行Driver发送的Task,并向Driver汇报计算结果。


部署模式

Standalone

独立模式,自带完整的服务,可单独部署到一个集群中,无需依赖其他任何的资源管理系统,从一定程度上说,该模式是其他模式的基础

Cluster Manager: Master

WorkerNode:Worker

仅支持粗粒度的资源分配方式

SparkOnYARN

YARN拥有强大的社区支持,且逐步成为大数据集群资源管理系统的标准

在国内生产环境中运用最广泛的部署模式

SparkOnYARN 支持的两种模式:yarn-cluster(生产环境),yarn-client(交互和调试)

Cluster Manager:ResourceManager

WorkNode:NodeManager

仅支持粗粒度的资源分配方式

SparkOnMesos

官方推荐模式,Spark开发之初就考虑到了支持Mesos

Spark运行在Mesos上会更加的灵活,更加自然

ClusterManager:MesosMaster

WorkNode: MesosSlave

支持粗粒度、细粒度的资源分配方式

粗粒度模式

Coarse-grained Mode:每个程序的运行由一个Driver和若干个Executor组成,其中每个Executor占用若干资源,内部可以运行多个Task。应用程序的各个任务正式运行之前,需要将运行环境中的资源全部申请好,且运行过程中需要一直占用着这些资源,即使不用,最后程序运行结束后,自动回收这些资源。


细粒度模式

鉴于粗粒度模式造成的大量资源的浪费,SparkOnMesos还提供了另一个调度模式就是细粒度模式。

这种模式类似于现在的云计算思想,核心是按需分配。


如何选择

生产环境中原则YARN,国内使用最广的模式

Spark的初学者,Standalone模式,简单

开发测试环境可选Standalone

数据量不太大、应用不复杂,可使用Standalone

相关术语

Application 用户提交的Spark应用程序,由集群中的一个Driver和许多的Executor组成

ApplicationJAR 一个包含Spark应用程序的JAR,JAR不应该包含Spark或者Hasoop的JAR

DriverProgram运行应用程序的main(),并创建SparkContext

ClusterManager管理集群资源的服务,如Standalone、YARN、Mesos

DeployMode区分Driver进程在何处运行,在Cluster模式下,在集群内部运行Driver,在Client模式下,Driver在集群外部运行

Worker Node 运行应用程序的工作节点

Executor 运行应用程序Task和保存数据,每个应用程序都有自己的Executors,并且和Executor相互独立

Task Executors 应用程序的最小单元

Job,在用户程序中,每次调用Action函数都会产生一个新的Job,也就是说每一个Action都会生成一个Job

Stage,一个Job被分解为多个Stage,每个Stage是一系列Task的集合


相关实践学习
基于MaxCompute的热门话题分析
Apsara Clouder大数据专项技能认证配套课程:基于MaxCompute的热门话题分析
目录
相关文章
|
6月前
|
人工智能 分布式计算 大数据
大数据≠大样本:基于Spark的特征降维实战(提升10倍训练效率)
本文探讨了大数据场景下降维的核心问题与解决方案,重点分析了“维度灾难”对模型性能的影响及特征冗余的陷阱。通过数学证明与实际案例,揭示高维空间中样本稀疏性问题,并提出基于Spark的分布式降维技术选型与优化策略。文章详细展示了PCA在亿级用户画像中的应用,包括数据准备、核心实现与效果评估,同时深入探讨了协方差矩阵计算与特征值分解的并行优化方法。此外,还介绍了动态维度调整、非线性特征处理及降维与其他AI技术的协同效应,为生产环境提供了最佳实践指南。最终总结出降维的本质与工程实践原则,展望未来发展方向。
345 0
|
5月前
|
存储 Java 大数据
Java 大视界 -- Java 大数据在智能家居能源消耗模式分析与节能策略制定中的应用(198)
简介:本文探讨Java大数据技术在智能家居能源消耗分析与节能策略中的应用。通过数据采集、存储与智能分析,构建能耗模型,挖掘用电模式,制定设备调度策略,实现节能目标。结合实际案例,展示Java大数据在智能家居节能中的关键作用。
|
9月前
|
存储 分布式计算 Hadoop
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
从“笨重大象”到“敏捷火花”:Hadoop与Spark的大数据技术进化之路
446 79
|
11月前
|
缓存 分布式计算 资源调度
Spark 与 MapReduce 的 Shuffle 的区别?
MapReduce 和 Spark 在 Shuffle 过程中有显著区别。MapReduce 采用两阶段模型,中间数据写入磁盘,I/O 开销大;而 Spark 使用基于内存的多阶段执行模型,支持操作合并和内存缓存,减少 I/O。Spark 的 RDD 转换优化减少了 Shuffle 次数,提升了性能。此外,Spark 通过 lineage 实现容错,资源管理更灵活,整体大数据处理效率更高。
|
12月前
|
存储 分布式计算 大数据
Flume+Hadoop:打造你的大数据处理流水线
本文介绍了如何使用Apache Flume采集日志数据并上传至Hadoop分布式文件系统(HDFS)。Flume是一个高可用、可靠的分布式系统,适用于大规模日志数据的采集和传输。文章详细描述了Flume的安装、配置及启动过程,并通过具体示例展示了如何将本地日志数据实时传输到HDFS中。同时,还提供了验证步骤,确保数据成功上传。最后,补充说明了使用文件模式作为channel以避免数据丢失的方法。
605 4
|
存储 分布式计算 Hadoop
数据湖技术:Hadoop与Spark在大数据处理中的协同作用
【10月更文挑战第27天】在大数据时代,数据湖技术凭借其灵活性和成本效益成为企业存储和分析大规模异构数据的首选。Hadoop和Spark作为数据湖技术的核心组件,通过HDFS存储数据和Spark进行高效计算,实现了数据处理的优化。本文探讨了Hadoop与Spark的最佳实践,包括数据存储、处理、安全和可视化等方面,展示了它们在实际应用中的协同效应。
568 2
|
2月前
|
Cloud Native Serverless API
微服务架构实战指南:从单体应用到云原生的蜕变之路
🌟蒋星熠Jaxonic,代码为舟的星际旅人。深耕微服务架构,擅以DDD拆分服务、构建高可用通信与治理体系。分享从单体到云原生的实战经验,探索技术演进的无限可能。
微服务架构实战指南:从单体应用到云原生的蜕变之路
|
弹性计算 API 持续交付
后端服务架构的微服务化转型
本文旨在探讨后端服务从单体架构向微服务架构转型的过程,分析微服务架构的优势和面临的挑战。文章首先介绍单体架构的局限性,然后详细阐述微服务架构的核心概念及其在现代软件开发中的应用。通过对比两种架构,指出微服务化转型的必要性和实施策略。最后,讨论了微服务架构实施过程中可能遇到的问题及解决方案。
|
5月前
|
缓存 Cloud Native Java
Java 面试微服务架构与云原生技术实操内容及核心考点梳理 Java 面试
本内容涵盖Java面试核心技术实操,包括微服务架构(Spring Cloud Alibaba)、响应式编程(WebFlux)、容器化(Docker+K8s)、函数式编程、多级缓存、分库分表、链路追踪(Skywalking)等大厂高频考点,助你系统提升面试能力。
278 0