Spark SQL大数据分析快速上手-完全分布模式安装

完全分布模式也叫集群模式。将Spark目录文件分发到其他主机并配置workers节点，即可快速配置Spark集群（需要先安装好JDK并配置好从Master到Worker的SSH信任）。具体步骤如下：

集群主机配置如表2-1所示。所有主机在相同目录下安装JDK，Spark安装到所有主机的相同目录下，如/app/。

这里推荐直接使用下面链接讲解的、配置好的Hadoop完全分布式环境，稍微做些修改，即可快速搭建Spark完全分布模式环境。

在server101上解压Spark：

复制代码

$ tar -zxvf ~/spark-3.3.1-bin-hadoop3.tgz -C /app/

$ mv spark-3.3.1-bin-hadoop3 spark-3.3.1

修改spark-env.sh文件，在文件最开始添加JAVA_HOME环境变量：

复制代码

$ vim /app/spark-3.3.1/sbin/spark-conf.sh

export JAVA_HOME=/usr/java/jdk1.8.0-361

修改worker文件，添加所有主机在worker节点上的名称：

复制代码

$ vim /app/spark-3.3.1/conf/workers

server101

server102

server103

使用scp将Spark目录分发到所有主机相同的目录下：

复制代码

$ scp -r /app/spark-3.3.1  server102:/app/

$ scp -r /app/spark-3.3.1  server103:/app/

$ /app/spark-3.3.1/sbin/start-all.sh

启动完成以后，查看master主机的8080端口，如图2-8所示。

由于已经配置了Hadoop集群，并且与Spark的worker节点在相同的主机上，因此在集群环境下，一般是访问HDFS上的文件：

复制代码

$spark-shell --master spark://server101:7077

scala> val rdd1 = sc.textFile("hdfs://server101:8082/test/a.txt");

图2-8 master主机的8080端口

将结果保存到HDFS，最后查看HDFS上的计算结果即可：

复制代码

scala> rdd1.flatMap(_.split("\\s+")).map((_,1)).reduceByKey(_+_). saveAsTextFile("hdfs://server101:8020/out004");