在spark中配置历史服务器

在 Spark 中配置历史服务器,可按以下步骤操作:

1. 配置 spark-defaults.conf 文件

此文件一般位于 $SPARK_HOME/conf 目录下。若该文件不存在,可从 spark-defaults.conf.template 复制一份。

在文件里添加如下配置:

plaintext

复制代码
spark.eventLog.enabled           true
spark.eventLog.dir               hdfs://<namenode>:<port>/spark-logs

其中,<namenode> 是 HDFS 名称节点的主机名,<port> 是 HDFS 名称节点的端口号。你要确保 HDFS 路径存在,并且 Spark 有写入该路径的权限。

2. 配置 spark-env.sh 文件

同样在 $SPARK_HOME/conf 目录下,若文件不存在,可从 spark-env.sh.template 复制一份。

添加如下配置:

bash

复制代码
export SPARK_HISTORY_OPTS="-Dspark.history.fs.logDirectory=hdfs://<namenode>:<port>/spark-logs -Dspark.history.ui.port=18080"

这里的 <namenode> 和 <port> 要和 spark-defaults.conf 里的配置一致。18080 是历史服务器的端口号,你可按需修改。

3. 启动历史服务器

在 Spark 集群的任意节点上运行以下命令来启动历史服务器:

bash

复制代码
$SPARK_HOME/sbin/start-history-server.sh

4. 访问历史服务器

启动成功后,你可以通过浏览器访问 http://<hostname>:18080 来查看 Spark 作业的历史记录,其中 <hostname> 是运行历史服务器的节点的主机名。

5. 停止历史服务器

若要停止历史服务器,可运行以下命令:

bash

复制代码
$SPARK_HOME/sbin/stop-history-server.sh

通过以上步骤,你就能成功在 Spark 中配置并使用历史服务器了。要注意的是,配置完成后,后续运行的 Spark 作业的日志会被记录到指定的 HDFS 路径,这样你就能在历史服务器上查看这些作业的详细信息了。

分享

相关推荐
夏幻灵19 分钟前
JavaScript this 面试:五种绑定规则、优先级与常见面试陷阱
开发语言·javascript·面试
三天不学习1 小时前
Egg.js 4 突然爆火,原因是否归结于AI 原生落地需求爆发?
前端·javascript·全栈·egg.js
xcs194052 小时前
前端 vue 的前端页面debugger 进不去
前端·javascript·vue.js
天启HTTP2 小时前
爬虫防封核心原理:IP轮换机制与风控规避逻辑
linux·服务器·网络·爬虫·tcp/ip
运维行者_2 小时前
网络性能监控怎么做?从自动发现到根因分析的4个环节
运维·服务器·网络·人工智能·支持向量机
hz567894 小时前
涉密视频会议设备配置指南:终端、音视频采集与配套设施选型
服务器·网络·数据库·安全·实时音视频·信息与通信·智能硬件
广州浮点FLOATLIC4 小时前
许可证服务器迁移后软件打不开:研发 IT 怎样定位连接问题
linux·服务器·数据库
优橙教育4 小时前
零基础学AI应用开发要多久?3个月能到什么水平
服务器·开发语言·网络·php
AIgorithmGEEK5 小时前
[Linux]从手写报头到内核套路:序列化、反序列化与自定义协议全链路
linux·运维·服务器·网络·序列化·反序列化
Nil2085 小时前
leetcode 139单词拆分
linux·运维·服务器