1、确认已安装的Hadoop版本
hadoop version
根据计算机安装的Hadoop版本,选择对应的spark版本下载并安装
2、确定Spark、Scala版本
在http://spark.apache.org/downloads.html 下载页,选择下载
3、安装Scala
在https://www.scala-lang.org/download/ 下载安装对应版本Scala
- Scala 2.11.12:https://www.scala-lang.org/download/2.11.12.html
cd ~# 下载wget https://downloads.lightbend.com/scala/2.11.12/scala-2.11.12.tgz# 解压sudo tar -zxf scala-2.11.12.tgz -C /usr/local# 重命名sudo mv /usr/local/scala-2.11.12/ /usr/local/scala# 修改目录及其子文件用户权限sudo chown -R hadoop /usr/local/scala/# 添加环境变量echo 'export SCALA_HOME=/usr/local/scalaexport PATH=$PATH:$SCALA_HOME/bin' >> ~/.bashrcsource ~/.bashrc# 验证scala -version

4、安装Spark
cd ~# 下载wget https://mirrors.bfsu.edu.cn/apache/spark/spark-3.1.1/spark-3.1.1-bin-hadoop3.2.tgz# 解压sudo tar -zxf spark-3.1.1-bin-hadoop3.2.tgz -C /usr/local# 重命名sudo mv /usr/local/spark-3.1.1-bin-hadoop3.2/ /usr/local/spark# 修改目录及其子文件用户权限sudo chown -R hadoop /usr/local/spark/# 添加环境变量echo 'export SPARK_HOME=/usr/local/sparkexport PATH=$PATH:$SPARK_HOME/bin' >> ~/.bashrcsource ~/.bashrc# 验证spark-shell
输入
:quit退出spark-shell
5、配置spark
cd /usr/local/spark/conf
cp spark-env.sh.template spark-env.shecho 'JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64HADOOP_HOME=/usr/local/hadoopHADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoopSCALA_HOME=/usr/local/scalaSPARK_HOME=/usr/local/sparkSPARK_MASTER_IP=masterSPARK_EXECUTOR_MEMORY=1G' >> spark-env.sh
cp workers.template workersecho 'node1node2' > workers
6、将Scala、Spark打包发送至node1、node2
cd /usr/localtar -zcf ~/scala.master.tar.gz ./scalatar -zcf ~/spark.master.tar.gz ./sparkscp ~/scala.master.tar.gz node1:/home/hadoopscp ~/spark.master.tar.gz node1:/home/hadoopscp ~/scala.master.tar.gz node2:/home/hadoopscp ~/spark.master.tar.gz node2:/home/hadoop
7、配置worker
切换到node1/node2
cd ~sudo tar -zxf scala.master.tar.gz -C /usr/localsudo tar -zxf spark.master.tar.gz -C /usr/localsudo chown -R hadoop /usr/local/scala/sudo chown -R hadoop /usr/local/spark/echo 'export SCALA_HOME=/usr/local/scalaexport PATH=$PATH:$SCALA_HOME/binexport SPARK_HOME=/usr/local/sparkexport PATH=$PATH:$SPARK_HOME/bin' >> ~/.bashrcsource ~/.bashrcrm scala.master.tar.gz spark.master.tar.gz
8、启动Spark,回到master
# 启动hadoopstart-all.sh# 启动Spark(注意./,因为spark的很多脚本和hadoop名称一样,所以这里没有为spark的脚本添加环境变量)cd /usr/local/spark/sbin./start-all.sh
9、测试Spark
cd /usr/local/spark/bin./run-example SparkPi 2>&1 | grep "Pi is"

部分参考: https://blog.csdn.net/weixin_39660922/article/details/112744170 https://blog.csdn.net/sjmz30071360/article/details/82561867
输入