9_Spark安装

下载spark压缩包

通过百度网盘分享的文件:spark-2.0.2-bin-hadoop2.6.tgz

链接:https://pan.baidu.com/s/1lXPExVxxdkdx1QjiLlaorw

提取码:yc69

通过百度网盘分享的文件:scala-2.11.8.tgz

链接:https://pan.baidu.com/s/1YR4enZqTgE-Yy3Jb456JIQ

提取码:yc69

1.Scala配置
  • 分别在master、slave1、slave2上执行。

解压Scala压缩包,进入解压后的Scala目录

pwd

复制代码
vim /root/.bashrc

添加环境变量:

text 复制代码
#set scala environment
export SCALA_HOME=/usr/local/src/scala-2.11.8
export PATH=$PATH:${SCALA_HOME}/bin
#set spark environment
export SPARK_HOME=/usr/local/src/spark-2.0.2-bin-hadoop2.6
export PATH=$PATH:${SPARK_HOME}/bin

验证:

复制代码
bash
scala -version
2.Spark集群配置

解压Spark压缩包

进入解压后的Spark目录

cd conf/

添加和修改slaves文件
复制代码
cp slaves.template slaves
vim slaves
# 将 localhost 修改为:
slave1
slave2
添加和修改 spark-env.sh 文件
复制代码
cp spark-env.sh.template spark-env.sh
vim spark-env.sh

添加配置:

text 复制代码
export SCALA_HOME=/usr/local/src/scala-2.11.8
export JAVA_HOME=/usr/local/src/jdk1.8.0_181
export HADOOP_HOME=/usr/local/src/hadoop-2.6.1
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
SPARK_MASTER_WEBUI_PORT=8989
SPARK_MASTER_IP=master
SPARK_LOCAL_DIRS=/usr/local/src/spark-2.0.2-bin-hadoop2.6
SPARK_DRIVER_MEMORY=1G
分发Spark到slave节点
复制代码
# 进入 /usr/local/src 目录
scp -rp spark-2.0.2-bin-hadoop2.6/ slave1:`pwd`
scp -rp spark-2.0.2-bin-hadoop2.6/ slave2:`pwd`
3.启动集群
复制代码
cd sbin/
./start-all.sh
jps
4.网页监控面板

master:8989

5.验证

进入Spark目录

复制代码
# 集群 Standalone
./bin/spark-submit --class org.apache.spark.examples.SparkPi --master spark://master:7077 ./examples/jars/spark-examples_2.11-2.0.2.jar 10
# 集群 spark on Yarn
./bin/spark-submit --class org.apache.spark.examples.SparkPi --master yarn-cluster ./examples/jars/spark-examples_2.11-2.0.2.jar 10

相关推荐
周杰伦_Jay20 分钟前
【 RocketMQ 全解析】分布式消息队列的架构、消息转发与快速实践、事务消息
分布式·算法·架构·rocketmq·1024程序员节
数据与人工智能律师33 分钟前
数据淘金时代的法治罗盘:合法收集、使用与变现数据的边界与智慧
大数据·网络·人工智能·云计算·区块链
阿祥~37 分钟前
windows 安装 TDengine
大数据·时序数据库·tdengine
武子康1 小时前
大数据-136 - ClickHouse 集群 表引擎详解 选型实战:TinyLog/Log/StripeLog/Memory/Merge
大数据·分布式·后端
兜兜风d'2 小时前
RabbitMQ TTL机制详解
分布式·rabbitmq·ruby
9ilk2 小时前
【仿RabbitMQ的发布订阅式消息队列】--- 介绍
linux·笔记·分布式·后端·rabbitmq
北邮-吴怀玉3 小时前
2.2.1.3 大数据方法论与实践指南-文档管理规范
大数据·数据治理
B站_计算机毕业设计之家5 小时前
计算机视觉:python车牌识别检测系统 YOLOv8 深度学习pytorch技术 LPRNet车牌识别算法 CCPD2020数据集 ✅
大数据·python·深度学习·机器学习·计算机视觉·数据分析·车牌识别
FreeBuf_8 小时前
从“策略对抗”到“模型对抗”:朴智平台如何重塑金融风控新范式?
大数据·人工智能
HitpointNetSuite9 小时前
连锁餐饮行业ERP如何选择:为何Oracle NetSuite成为增长新引擎
大数据·运维·数据库·oracle·netsuite