Linux安装 spark 教程详解

目录

[一 准备安装包](#一 准备安装包)

[二 安装 scala](#二 安装 scala)

[三 修改配置文件](#三 修改配置文件)

[1)修改 workers 文件](#1)修改 workers 文件)

[2)修改 spark-env.sh文件](#2)修改 spark-env.sh文件)

[四 进入 spark 交互式平台](#四 进入 spark 交互式平台)


一 准备安装包

可以自行去 spark 官网下载想要的版本

这里准备了 spark3.1.2的网盘资源

链接: https://pan.baidu.com/s/1Brm6XqaqYQnXQwOd8mUt7A?pwd=2bye 提取码: 2bye

下载后上传至 linux 服务器上

这里放在了 /opt/install 目录

解压至 /opt/soft 目录

复制代码
tar -zxf /opt/install/spark-3.1.2-bin-hadoop3.2.tgz -C /opt/soft/

改个名

复制代码
cd /opt/soft

mv spark-3.1.2-bin-hadoop3.2/ spark312

修改一下环境变量

复制代码
#SPARK_HOME
export SPARK_HOME=/opt/soft/spark312
export PATH=$SPARK_HOME/bin:$PATH

二 安装 scala

安装过scala的 朋友可以跳过此步骤

scala 的安装比较简单,spark 的运行环境需要 scala

这里同样准备了网盘资源

链接: https://pan.baidu.com/s/1ua01OvTYjFQyG82AG1g1yg?pwd=imc6 提取码: imc6

下载后上传至 linux 服务器上

这里放在了 /opt/install 目录

解压至 /opt/soft 目录

复制代码
tar -zxf /opt/install/scala-2.12.10.tgz -C /opt/soft/

解压后改个名

复制代码
mv scala-2.12.10/ scala212

修改环境变量,末尾添加下面内容

复制代码
#SCALA_HOME
export SCALA_HOME=/opt/soft/scala212
export PATH=$SCALA_HOME/bin:$PATH

修改后保存退出,source一下

复制代码
 source /etc/profile

三 修改配置文件

进入 spark312/conf 目录

将 两个临时文件cp 一下

复制代码
cp spark-env.sh.template spark-env.sh

cp workers.template workers

1)修改 workers 文件

复制代码
vim workers

由于这里就是单机版,所以就不做修改

2)修改 spark-env.sh文件

复制代码
vim spark-env.sh

添加配置,这里根据自己的各个安装包的位置来

复制代码
export SCALA_HOME=/opt/soft/scala212
export JAVA_HOME=/opt/soft/jdk180
export SPARK_HOME=/opt/soft/spark312
export HADOOP_INSTALL=/opt/soft/hadoop313
export HADOOP_CONF_DIR=$HADOOP_INSTALL/etc/hadoop
export SPARK_MASTER_IP=172.25.38.169
export SPARK_DRIVER_MEMORY=2G
export SPARK_EXECUTOR_MEMORY=2G
export SPARK_LOCAL_DIRS=/opt/soft/spark312

四 进入 spark 交互式平台

输入命令回车

复制代码
 spark-shell

未给参数默认等同于下面的命令

复制代码
spark-shell --master local[*]

创建一个 RDD

复制代码
sc.parallelize(1 to 10,3)
相关推荐
机器学习之心19 小时前
上海原油期货收益率研究数据集说明
大数据·人工智能·上海原油期货收益率
计算机安禾19 小时前
【算法分析与设计】第19篇:二分图匹配与指派问题
大数据·人工智能·算法
Jason_zhao_MR19 小时前
纳秒级抖动×24小时零丢帧:RK3576工业级EtherCAT主站全拆解
大数据·人工智能·单片机·嵌入式
TDengine (老段)20 小时前
TDengine WAL 预写日志机制 — 持久性保障与崩溃恢复
大数据·数据库·物联网·时序数据库·iot·tdengine·涛思数据
HZZSDSCYZ20 小时前
2026年杭州电商新趋势:专业公司如何引领未来市场
大数据·人工智能·python
Ws_20 小时前
Git + Gerrit 第四课:合并冲突解决
大数据·elasticsearch·搜索引擎
搞科研的小刘选手21 小时前
【经管方向EI会议】第七届经济管理与大数据应用国际学术会议(ICEMBDA2026)
大数据·区块链·可视化·管理·供应链·经济·消费者行为
久菜盒子工作室21 小时前
港股创新药趋势走坏了吗
大数据·人工智能
出海小龙21 小时前
联盟营销实战技能体系:从市场研究到数据优化的完整盈利框架
大数据·前端·人工智能
无忧智库1 天前
某能源集团多Agent协同的电力交易策略优化与实时调度决策系统建设方案(WORD)
大数据·人工智能·自动化