spark本地模式基础配置流程

1、创建新用户,授予sudo权限

bash 复制代码
# 新建用户
# root账户下执行
adduser wd_ll
usermod -aG sudo wd_ll
visudo
# 在文件末尾添加:
wd_ll ALL=(ALL:ALL) ALL
# 按 Ctrl+X,然后 Y 保存退出

2、创建文件目录,上传解压文件

bash 复制代码
# 创建一个专门的文件目录
sudo mkdir /opt/hadoop-cluster
# 解压文件
sudo tar -zxvf tool/jdk-8u361-linux-x64.tar.gz -C /opt/hadoop-cluster/
sudo tar -zxvf tool/hadoop-3.3.5.tar.gz -C /opt/hadoop-cluster/
sudo tar -zxvf tool/spark-3.5.7-bin-hadoop3.tgz -C /opt/hadoop-cluster/
# 创建软连接
sudo ln -s /opt/hadoop-cluster/jdk1.8.0_361 /opt/hadoop-cluster/java
sudo ln -s /opt/hadoop-cluster/hadoop-3.3.5 /opt/hadoop-cluster/hadoop
sudo ln -s /opt/hadoop-cluster/spark-3.5.7-bin-hadoop3 /opt/hadoop-cluster/spark

3、创建专门的环境变量文件,配置文件

bash 复制代码
# 创建一个单独的文件
sudo vim /etc/profile.d/env.sh
# 配置环境变量 如下:
###
# Java 环境变量
export JAVA_HOME=/opt/hadoop-cluster/java
export PATH=$PATH:$JAVA_HOME/bin

# Hadoop 环境变量
export HADOOP_HOME=/opt/hadoop-cluster/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop

# Spark 环境变量
export SPARK_HOME=/opt/hadoop-cluster/spark
export PATH=$PATH:$SPARK_HOME/bin:$SPARK_HOME/sbin
###

# 更新环境变量 使配置生效
source /etc/profile.d/env.sh

4、安装conda

bash 复制代码
# 安装minconda3
sh tool/Miniconda3-py39_23.5.2-0-Linux-x86_64.sh
# 创建conda环境
mkdir /home/wd_ll/miniconda3/envs/pyspark_env
# 将打包好的环境解压到对应路径下
tar -zxvf tool/pyspark-env.tar.gz -C /home/wd_ll/miniconda3/envs/pyspark_env/

5、将文件目录授权给指定用户

bash 复制代码
sudo chown -R wd_ll: /opt/hadoop-cluster

6、检查主要组件是否安装完成

bash 复制代码
# 检查 java
java -version
# 检查 hadoop
hadoop version
# 检查 spark
pyspark
# 检查 python
python -V
# 检查 conda 
conda env list
相关推荐
IT大白鼠3 分钟前
MySQL 分布式集群系列 · 第七篇——生产调优实战:NDB 性能、内存、高可用全方位优化
数据库·分布式·mysql
四季豆3330 分钟前
工业大数据不只是“大”,更是制造业突围的“导航仪”
大数据
newsxun1 小时前
光智融合,空间新生|Jupiter SR 亮相光博会CIOE 2026
大数据·人工智能
大树881 小时前
液冷系统的真正瓶颈,藏在那层不到1毫米的材料里
大数据·运维·服务器·人工智能·ai
Vicky_time1 小时前
2026美国海外仓TOP5技术评测:FBA中转海外仓系统对接与操作方案
大数据·系统架构
北京晶数信息科技2 小时前
加油机数据采集设备加油机数据采集器加油机智能采集器液位仪数据采集设备原厂成品油流通数智化综合监管平台技术原理与落地应用解决方案
大数据·人工智能·物联网·需求分析
凌风的跨境分享2 小时前
Temu店群运维提效:定时策略自动化任务全场景实操指南
大数据·运维·前端·人工智能·架构·自动化
Elastic 中国社区官方博客2 小时前
Elasticsearch 向量数据库:几分钟内完成部署,以经济高效的方式扩展至数千亿规模
大数据·运维·数据库·elasticsearch·搜索引擎·ai·全文检索
A hao2 小时前
LED视频处理器中帧率与刷新率的区别
大数据·图像处理·人工智能·音视频
AgentMaster2 小时前
数据治理工具选型指南:一套可复用的四阶段决策框架
大数据·数据结构·人工智能·算法