Linux安装Spark的详细过程

一、安装以及解压缩spark的过程(以下步骤全部都是在master机器上进行的步骤)

安装:文件提取链接:https://pan.baidu.com/s/1XI_mRKY2c6CHlt6--3d7kA?pwd=tlu2

(可以导入至U盘中,再从U盘拷入至虚拟机中,这点在我讲述安装jdk8的文章中有提到过,如果有兴趣,可以去看一下:http://t.csdn.cn/POerk

  • 我把jdk8、hadoop-3.3.4、zookeeper-3.6.2、hbase-2.3.3、spark-3.2.2的解压后的文件放在了"opt"文件里,而它们的压缩包统一放在了"opt"的software文件夹(可以自己创建)中。
  • 解压缩spark-3.2.2:

二、配置Spark的环境变量

  • bashrc的路径:主文件夹------>其它位置------>计算机------>etc------>bashrc(/etc/bashrc) ;
  • workers.template、spark-env.sh template的路径:主文件夹------>其它位置------>计算机------>opt------>spark-3.2.2------>conf(/opt/hbase-2.3.3/conf);
  • 第二点的两个文件都需要用文本编辑器打开;
  • 这三个文件在关闭之前必须记得保存之后再关闭。
  1. 在bashrc中增加spark的环境变量(三个虚拟机都需要添加以下内容

    复制代码
    #spark_config
    export SPARK_HOME=/opt/spark-3.2.2
    export PATH=$PATH:$SPARK_HOME/bin
  2. 修改workers.template的文件名称以及内容

    复制代码
    master
    slave0
    slave1
  3. 修改spark-env.sh template的文件名称以及添加以下内容

    复制代码
    export JAVA_HOME=/opt/jdk1.8.0_261
    export HADOOP_HOME=/opt/hadoop-3.3.4
    export SPARK_MASTER_IP=master
    export SPARK_MASTER_PORT=7077
    export SPARK_DIST_CLASSPATH=$(/opt/hadoop-3.3.4/bin/hadoop classpath)
    export HADOOP_CONF_DIR=/opt/hadoop-3.3.4/etc/hadoop
    export SPARK_YARN_USER_ENV="CLASSPATH=/opt/hadoop-3.3.4/etc/hadoop"
    export YARN_CONF_DIR=/opt/hadoop-3.3.4/etc/hadoop
  4. 生效bashrc文件(三台虚拟机在修改完bashrc文件后,都需要在终端中对bashrc进行生效

    复制代码
    source /etc/bashrc

三、 master远程发送文件给slave0和slave1

这一步骤在之前的安装jdk、hadoop、zookeeper、hbase都有提到过,如果有兴趣的话,可以去看一下:http://t.csdn.cn/qhTlj

四、启动Spark

  • 启动spark之前,需要启动hadoop、zookeeper和hbase,因为spark也是需要架构在hadoop基础上的。(启动hadoop、zookeeper、hbase可以去查看一下之前的文章:http://t.csdn.cn/qhTlj,我都有提到过);
  • 启动路径:/opt/spark-3.2.2/sbin/start-all.sh
  • 启动命令:./start-all.sh
  • 启动spark后,jsp进程master会出现Master与Workerslave0与slave1出现的是Worker

五、运行SparkPI

复制代码
[root@master spark-3.2.2]# ./bin/spark-submit --class org.apache.spark.examples.SparkPi --master spark://master:7077 examples/jars/spark-examples_2.12-3.2.2.jar 

六、关闭Spark

  • 以上就是linux安装spark的全部过程了,如遇问题可以留言或者私信。
相关推荐
腾科IT教育10 小时前
Oracle认证怎么选?2026年OCP/OCM报考指南
linux·运维·华为认证·hcie·开闭原则·datacom
企业智能研究12 小时前
企业如何落地企微私域智能客服来降本增效:从技术选型到实施落地的完整指南
大数据·人工智能·企业微信·智能客服
delishcomcn12 小时前
边缘计算+AI模型:电化铝分切装备的智能化改造路径
大数据·人工智能·边缘计算
太原geo小侦探13 小时前
2026门店AI流量实测测评:同为实体门店,AI问答曝光差距在哪?
大数据·人工智能·生活·流量运营·内容运营
AI大法师13 小时前
一个机场如何被做成 IP 场景:宝可梦机场的设计方法总结
大数据·人工智能·设计模式·新媒体运营
longerxin202014 小时前
nano编辑器插入、编辑完整操作教程(Linux日志/配置专用)
linux·运维·编辑器
朴马丁15 小时前
从制造到智造:PLM如何赋能企业研发创新
大数据·运维·人工智能·食品行业·流程行业plm·化工新材料行业·新能源材料行业
听风34717 小时前
Arch Linux 软件安装完全指南
linux·运维·archlinux·pacman
网络安全零基础教程18 小时前
网络安全春招面试避坑与复盘指南
linux·网络·安全·web安全·面试·职场和发展
大大大大晴天️18 小时前
Hudi + StarRocks 查询加速:原理与实践
大数据·starrocks·hudi