spark 任务运行原理

时间：2023-05-31 12:05:08浏览次数：31

标签：task 作业 Executor 原理 spark 执行 Spark 运行 stage

调优概述

在开发完Spark作业之后，就该为作业配置合适的资源了。Spark的资源参数，基本都可以在spark-submit命令中作为参数设置。很多Spark初学者，通常不知道该设置哪些必要的参数，以及如何设置这些参数，最后就只能胡乱设置，甚至压根儿不设置。资源参数设置的不合理，可能会导致没有充分利用集群资源，作业运行会极其缓慢；或者设置的资源过大，队列没有足够的资源来提供，进而导致各种异常。总之，无论是哪种情况，都会导致Spark作业的运行效率低下，甚至根本无法运行。因此我们必须对Spark作业的资源使用原理有一个清晰的认识，并知道在Spark作业运行过程中，有哪些资源参数是可以设置的，以及如何设置合适的参数值。

Spark作业基本运行原理

详细原理见上图。我们使用spark-submit提交一个Spark作业之后，这个作业就会启动一个对应的Driver进程。根据你使用的部署模式（deploy-mode）不同，Driver进程可能在本地启动，也可能在集群中某个工作节点上启动。Driver进程本身会根据我们设置的参数，占有一定数量的内存和CPU core。而Driver进程要做的第一件事情，就是向集群管理器（可以是Spark Standalone集群，也可以是其他的资源管理集群，美团•大众点评使用的是YARN作为资源管理集群）申请运行Spark作业需要使用的资源，这里的资源指的就是Executor进程。YARN集群管理器会根据我们为Spark作业设置的资源参数，在各个工作节点上，启动一定数量的Executor进程，每个Executor进程都占有一定数量的内存和CPU core。

在申请到了作业执行所需的资源之后，Driver进程就会开始调度和执行我们编写的作业代码了。Driver进程会将我们编写的Spark作业代码分拆为多个stage，每个stage执行一部分代码片段，并为每个stage创建一批task，然后将这些task分配到各个Executor进程中执行。task是最小的计算单元，负责执行一模一样的计算逻辑（也就是我们自己编写的某个代码片段），只是每个task处理的数据不同而已。一个stage的所有task都执行完毕之后，会在各个节点本地的磁盘文件中写入计算中间结果，然后Driver就会调度运行下一个stage。下一个stage的task的输入数据就是上一个stage输出的中间结果。如此循环往复，直到将我们自己编写的代码逻辑全部执行完，并且计算完所有的数据，得到我们想要的结果为止。

Spark是根据shuffle类算子来进行stage的划分。如果我们的代码中执行了某个shuffle类算子（比如reduceByKey、join等），那么就会在该算子处，划分出一个stage界限来。可以大致理解为，shuffle算子执行之前的代码会被划分为一个stage，shuffle算子执行以及之后的代码会被划分为下一个stage。因此一个stage刚开始执行的时候，它的每个task可能都会从上一个stage的task所在的节点，去通过网络传输拉取需要自己处理的所有key，然后对拉取到的所有相同的key使用我们自己编写的算子函数执行聚合操作（比如reduceByKey()算子接收的函数）。这个过程就是shuffle。

当我们在代码中执行了cache/persist等持久化操作时，根据我们选择的持久化级别的不同，每个task计算出来的数据也会保存到Executor进程的内存或者所在节点的磁盘文件中。

因此Executor的内存主要分为三块：第一块是让task执行我们自己编写的代码时使用，默认是占Executor总内存的20%；第二块是让task通过shuffle过程拉取了上一个stage的task的输出后，进行聚合等操作时使用，默认也是占Executor总内存的20%；第三块是让RDD持久化时使用，默认占Executor总内存的60%。

task的执行速度是跟每个Executor进程的CPU core数量有直接关系的。一个CPU core同一时间只能执行一个线程。而每个Executor进程上分配到的多个task，都是以每个task一条线程的方式，多线程并发运行的。如果CPU core数量比较充足，而且分配到的task数量比较合理，那么通常来说，可以比较快速和高效地执行完这些task线程。

以上就是Spark作业的基本运行原理的说明，大家可以结合上图来理解。理解作业基本原理，是我们进行资源参数调优的基本前提。

标签：task,作业,Executor,原理,spark,执行,Spark,运行,stage
From： https://blog.51cto.com/u_11908275/6385841

spark RDD底层原理
RDD底层实现原理RDD是一个分布式数据集，顾名思义，其数据应该分部存储于多台机器上。事实上，每个RDD的数据都以Block的形式存储于多台机器上，下图是Spark的RDD存储架构图，其中每个Executor会启动一个BlockManagerSlave，并管理一部分Block；而Block的元数据由Driver节点的BlockManagerMaster......
mDNS原理的简单理解——每个进入局域网的主机，如果开启了mDNS服务的话，都会向局域网内的
MDNS协议介绍mDNSmulticastDNS,使用5353端口，组播地址224.0.0.251。在一个没有常规DNS服务器的小型网络内，可以使用mDNS来实现类似DNS的编程接口、包格式和操作语义。MDNS协议的报文与DNS的报文结构相同，但有些字段对于MDNS来说有新的含义。每个进入局域网的主机，如果开启了mDNS服......
雷达原理与系统第九讲脉冲调制器
雷达原理与系统第九讲脉冲调制器1.雷达发射机——1).定义：为雷达提供一种载波受到调制的满足特定要求的大功率射频信号，经馈线和收发开关由天线辐射出去。2).分类——(1)按照波形方式分类——A.连续式发射机B.脉冲式发射机Ba.分类——a.单级振荡式：用一级大功率振荡......
BOSHIDA 电源模块高低温试验的应用原理
BOSHIDA电源模块高低温试验的应用原理电源模块是高低温试验的主要组成部分之一，其作用是提供试验所需的电力。在高低温试验中，温度的变化范围较大，因此电源模块需要能够在不同的温度下工作，并保证输出的稳定性和可靠性。一般来说，电源模块应该具备以下特点：1.宽温度范围，能够在......
运行mem-data-analysis-framework
下载：wgethttps://mem:[email protected]/mem-prototype/mem-data-analysis-framework.tar.gzdockerload<mem-data-analysis-framework.tar.gzdockerrun --network="host" -t -d mem-prototype:latest 然后访问localhost:8080即可看到代码！上传数据到dock......
动态IP地址的原理是什么？如何更换自己的网络IP？
动态IP地址的原理是通过动态主机配置协议（DynamicHostConfigurationProtocol，DHCP）来分配和管理IP地址。DHCP是一种网络协议，它允许计算机在连接到网络时自动获取IP地址、子网掩码、默认网关和其他网络配置信息。当您连接到互联网或局域网时，您的计算机或路由器将发送DHCP请......
docker容器踩过的坑：在idea可以运行，放到tomcat出现异常
1.docker里边安装tomcat,tomcat会自带jdk版本,使用也是默认的版本，要注意tomcat与是否与想要jdk版本的一致，在创建容器时就需要挂载jdk版本指令：dockerrun-id--name=c_tomcat-p8080:8080-v$PWD:/usr/local/tomcat/webapps-v/opt/jdk1.8.0_152:/opt/java/openjdktomcat ......
【视频】支持向量机算法原理和Python用户流失数据挖掘SVM实例
全文链接：http://tecdat.cn/?p=32604原文出处：拓端数据部落公众号分析师：BaileyZheng和Lijie Zhang即使是同一种植物，由于生长的地理环境的不同，它们的特征会有所差异。例如鸢尾花，可分为山鸢尾、杂色鸢尾、维吉尼亚鸢尾。假设此时您得到了一朵鸢尾花，如何判断它属于哪一类呢?支......
【视频】风险价值VaR原理与Python蒙特卡罗Monte Carlo模拟计算投资组合实例|附代码数
原文链接:http://tecdat.cn/?p=22862 最近我们被客户要求撰写关于风险价值的研究报告，包括一些图形和统计输出。风险价值(VaR)是一种统计数据，用于量化公司、投资组合在特定时间范围内可能发生的财务损失程度什么是风险价值（VaR）？该指标最常被投资银行和商业银行用来确定其机构......
Qemu仿真----(11)运行Gentoo Rootfs
平台：ubuntu-22.04-desktop-amd64.对象：gentoorootfs、qemu.文件：linux-6.1.26.tar.xz、stage3-arm64-systemd-20230528T234658Z.tar.xz.本例通过qemu运行gentoorootfsforarm64。1.安装依赖$sudoaptinstallqemu-user-staticqemu-system-aarch64systemd-containergc......

spark 任务运行原理

调优概述

Spark作业基本运行原理

相关文章

赞助商

阅读排行