pyspark 安装记录

1、安装软件

1、python 3.10

2、hadoop-3.3.4 里面的winutils 要记得添加

3、java-17

4、spark-3.5.1-bin-hadoop3

python 安装 pyspark,Jupyter notebook

python 复制代码
pip install pyspark
pip install jupyter notebook

2、添加环境变量

  1. JAVA_HOME=C:\PySparkService\java-17
  2. HADOOP_HOME=C:\PySparkService\hadoop-3.3.4
  3. SPARK_HOME=C:\PySparkService\spark-3.5.1-bin-hadoop3
  4. %JAVA_HOME%\bin
  5. %HADOOP_HOME%\bin
  6. %SPARK_HOME%\bin

下面环境不配置会报错

PYSPARK_PYTHON=python

#jupyter notebook 启动 pyspark

自己安装 jupyter notebook 使用下面环境变量

PYSPARK_DRIVER_PYTHON=jupyter

# anaconda 可能是下面的

PYSPARK_DRIVER_PYTHON=ipython

PYSPARK_DRIVER_PYTHON_OPTS=notebook

cmd 命令行启动pyspark

启动成功

PYSPARK_PYTHON=python

上面环境不设置会报下面错误

复制代码
Py4JJavaError: An error occurred while calling o56.showString.
: org.apache.spark.SparkException: Job aborted due to stage failure: Task 0 in stage 0.0 failed 1 times, most recent failure: Lost task 0.0 in stage 
相关推荐
Dust-Chasing42 分钟前
Claude Code源码剖析 - Claude Code 上下文压缩机制
人工智能·python·ai
Cloud_Shy6182 小时前
解读《Effective Python 3rd Edition》:从练气到老魔(第五章 Item 33 - 35)
开发语言·人工智能·笔记·python·学习方法
abcy0712132 小时前
python pandas csv异步后台清洗前端优先返回成功信息
前端·python·pandas
颜酱3 小时前
LangChain使用RAG 入门:让大模型读懂你的私有文档
python·langchain
天天进步20153 小时前
Python全栈项目--校园智能宿舍管理系统
开发语言·python
测试员周周3 小时前
【AI测试智能体-面试】AI测试面试60题(附回答思路)
人工智能·python·功能测试·测试工具·单元测试·自动化·测试用例
用户8356290780514 小时前
使用 Python 操作 Word 评论和回复
后端·python
Zella折耳根4 小时前
复习篇-继承和接口
java·开发语言·python
诗词在线4 小时前
求推荐飞花令
大数据·人工智能·python
yijianace4 小时前
Python线程与多线程完全总结(从入门到理解并发本质)
开发语言·python