hadoop分布式中某个 节点报错的解决案例

前言

在分布式节点中,发现有个节点显示不可用状态,因此需要紧急修复。

hadoop版本

目前这套集群hadoop的版本如下:

集群报错详细日志:

1/1 local-dirs are bad: /kkb/install/hadoop-2.6.0-cdh5.14.2/hadoopDatas/tempDatas/nm-local-dir; 1/1 log-dirs are b

报错分析

通过分析发现,应该是这个节点的磁盘空间满了。

这条错误信息指出 Hadoop 集群的 NodeManager 无法写入其配置的本地目录和日志目录。这通常发生在 Hadoop 集群启动时,NodeManager 尝试初始化时。错误的原因是指定的本地目录 (`local-dirs`) 和日志目录 (`log-dirs`) 不可用或不可写。

可能的原因包括:

  1. **目录不存在**:配置的路径可能不存在。

  2. **权限问题**:运行 Hadoop 的用户可能没有权限写入这些目录。

  3. **磁盘空间不足**:指定的磁盘可能已满。

  4. **SELinux 策略**:如果你的系统使用 SELinux,可能需要调整安全上下文。

  5. **目录损坏**:文件系统损坏或目录结构损坏。

解决步骤:

  1. **检查目录是否存在**:

```sh

ls -ld /kkb/install/hadoop-2.6.0-cdh5.14.2/hadoopDatas/tempDatas/nm-local-dir

ls -ld /kkb/install/hadoop-2.6.0-cdh5.14.2/logs/userlogs

```

  1. **创建缺失的目录**:

如果目录不存在,你需要手动创建它们:

```sh

mkdir -p /kkb/install/hadoop-2.6.0-cdh5.14.2/hadoopDatas/tempDatas/nm-local-dir

mkdir -p /kkb/install/hadoop-2.6.0-cdh5.14.2/logs/userlogs

```

  1. **检查权限**:

确保运行 Hadoop 的用户(例如 `hadoop` 用户)对这些目录具有写权限:

```sh

chown -R hadoop:hadoop /kkb/install/hadoop-2.6.0-cdh5.14.2/hadoopDatas/tempDatas/

chown -R hadoop:hadoop /kkb/install/hadoop-2.6.0-cdh5.14.2/logs/

```

  1. **检查磁盘空间**:

使用 `df -h` 检查磁盘空间是否已满。

  1. **调整 SELinux**:

如果你的系统使用 SELinux,可能需要调整策略或更改目录的安全上下文:

```sh

chcon -R -t hadoop_var_lib_t /kkb/install/hadoop-2.6.0-cdh5.14.2/hadoopDatas/tempDatas/

chcon -R -t hadoop_log_t /kkb/install/hadoop-2.6.0-cdh5.14.2/logs/

```

  1. **检查 Hadoop 配置**:

确保 `hdfs-site.xml` 和 `core-site.xml` 中配置的本地目录和日志目录路径正确无误。

  1. **格式化 NameNode(如果必要)**:

如果 NameNode 损坏,可能需要格式化。但这将删除所有 HDFS 数据,因此只有在安全模式或测试环境中才考虑执行此操作。

  1. **重启 Hadoop 服务**:

在解决了目录问题后,尝试重启 Hadoop 服务,特别是 NodeManager。

  1. **查看日志文件**:

检查 Hadoop 的日志文件,特别是 `hadoop-*.log` 文件,以获取更多错误信息。

  1. **联系管理员**:

如果你没有足够的权限或不熟悉系统,联系系统管理员来帮助解决问题。

请在进行任何重要更改之前备份重要数据,并确保你具有足够的系统管理知识或获得专业帮助。

通过50070端口进去发现确实是因为节点01的空间即将耗尽。

相关推荐
Coder_Boy_1 分钟前
基于Spring AI的分布式在线考试系统-事件处理架构实现方案
人工智能·spring boot·分布式·spring
AEIC学术交流中心17 分钟前
【快速EI检索 | ACM出版】2026年大数据与智能制造国际学术会议(BDIM 2026)
大数据·制造
wending-Y21 分钟前
记录一次排查Flink一直重启的问题
大数据·flink
十月南城24 分钟前
Hive与离线数仓方法论——分层建模、分区与桶的取舍与查询代价
数据仓库·hive·hadoop
UI设计兰亭妙微27 分钟前
医疗大数据平台电子病例界面设计
大数据·界面设计
初恋叫萱萱1 小时前
模型瘦身实战:用 `cann-model-compression-toolkit` 实现高效 INT8 量化
大数据
袁煦丞 cpolar内网穿透实验室1 小时前
远程调试内网 Kafka 不再求运维!cpolar 内网穿透实验室第 791 个成功挑战
运维·分布式·kafka·远程工作·内网穿透·cpolar
人间打气筒(Ada)1 小时前
GlusterFS实现KVM高可用及热迁移
分布式·虚拟化·kvm·高可用·glusterfs·热迁移
xu_yule1 小时前
Redis存储(15)Redis的应用_分布式锁_Lua脚本/Redlock算法
数据库·redis·分布式
互联网科技看点1 小时前
孕期科学补铁,保障母婴健康-仁合益康蛋白琥珀酸铁口服溶液成为产妇优选方案
大数据