Spark 提交模式的区别 - 《Spark 从基础到入门》

standalone
yarn client
- Yarn
yarn cluster

standalone

master和worker是物理节点，driver和executor是进程。

Master

一个集群有一个或多个master节点。master节点常驻master守护进程，负责管理worker节点，我们从master节点提交应用。

PS：一台机器可以同时作为master和worker节点（举个例子：你有四台机器，你可以选择一台设置为master节点，然后剩下三台设为worker节点，也可以把四台都设为worker节点，这种情况下，有一个机器既是master节点又是worker节点）

Worker

一个集群有多个worker节点。

worker节点常驻worker守护进程，与master节点通信，并且管理executor进程。

Driver进程

初始化：driver进程就是应用的main()函数并且构建sparkContext对象，当我们提交了应用之后，便会启动一个对应的driver进程，driver本身会根据我们设置的参数占有一定的资源（主要指cpu core和memory）。

申请并分配资源：driver可以运行在master上，也可以运行worker上（根据部署模式的不同）。driver首先会向集群管理者（standalone、yarn，mesos）申请spark应用所需的资源源也就是executor，然后集群管理者会根据spark应用所设置的参数在各个worker上分配一定数量的executor，每个executor都占用一定数量的cpu和memory。
划分stage并且执行：在申请到应用所需的资源以后，driver就开始调度和执行我们编写的应用代码了。driver进程会将我们编写的spark应用代码拆分成多个stage，每个stage执行一部分代码片段，并为每个stage创建一批tasks，然后将这些tasks分配到各个executor中执行。

Executor进程

从属于worker节点：executor进程宿主在worker节点上，一个worker可以有多个executor。

executor拥有线程池：每个executor持有一个线程池，每个线程可以执行一个task，executor执行完task以后将结果返回给driver，每个executor执行的task都属于同一个应用。

提供缓存RDD：此外executor还有一个功能就是为应用程序中要求缓存的 RDD 提供内存式存储，RDD 是直接缓存在executor进程内的，因此任务可以在运行时充分利用缓存数据加速运算。

yarn client

Yarn

ResourceManager

处理客户端请求
启动/监控ApplicationMaster
监控NodeManager
资源分配与调度

NodeManager

单个节点上的资源管理和任务管理
处理来自ResourceManager的命令
处理来自ApplicationMaster的命令

Driver

运行在client客户端
适用于调试，能直接看到各种日志
连接断了，任务就挂了

yarn cluster

ResourceManager

处理客户端请求
启动/监控ApplicationMaster
监控NodeManager
资源分配与调度

NodeManager

单个节点上的资源管理和任务管理
处理来自ResourceManager的命令
处理来自ApplicationMaster的命令

Driver

运行在第一个NodeManager中的ApplicationMaster
日志需要到某个结点查看
client断开，任务不受影响