大数据-之LibrA数据库系统告警处理(ALM-37014 Gaussdb进程锁文件已经存在)

告警解释

当集群中的CN实例或者DN实例锁文件创建失败时,产生该告警。

告警属性
告警ID 告警级别 可自动清除
37014 严重
告警参数
参数名称 参数含义
ServiceName 产生告警的服务名称
RoleName 产生告警的角色名称
HostName 产生告警的主机名
Instance 产生告警的实例
对系统的影响

发生数据库锁文件创建失败时,锁文件创建失败的实例可能无法启动,集群将无法正常启动。

可能原因

系统数据实例异常终止,导致系统中存在锁文件残留。

处理步骤
  1. 使用omm用户登录告警上报的节点。
  2. 初始化环境变量。 source ${BIGDATA_HOME}/mppdb/.mppdbgs_profile
  1. 执行如下命令获取出现告警的主机和数据实例的数据目录。(如下主机为10.252.153.218,数据目录为/srv/BigData/mppdb/data1/coordinator)

    复制代码
  2. 使用SSH方式登录上述主机,执行如下命令进入目录并检查是否存在postmaster.pid文件。

    复制代码
    • 是,执行5
    • 否,执行8
  3. 执行如下命令获取postmaster.pid文件中第一行的pid。

    复制代码
  4. 执行如下命令查看上述pid对应的进程是否存在。

    复制代码
    ps -ef |grep 42883
    复制代码
    omm       42883      1  4 Nov05 ?        17:25:59 /opt/huawei/Bigdata/mppdb/core/bin/gaussdb --coordinator -D /srv/BigData/mppdb/data1/coordinator
    omm      125791  55322  0 15:10 pts/0    00:00:00 grep --color=auto 42883
    • 是,执行7
    • 否,执行8
  5. 执行如下命令终止上述进程,并删除postmaster.pid文件后查看告警是否恢复。

    复制代码
    • 是,处理完毕。
    • 否,执行8
  6. 在FusionInsight Manager界面,单击"系统设置 > 日志下载"。

  7. 在"服务"下拉框中勾选"MPPDB",单击"确定"。

  8. 设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后1小时,单击"下载"。

相关推荐
字节跳动数据平台3 小时前
代码量减少 70%、GPU 利用率达 95%:火山引擎多模态数据湖如何释放模思智能的算法生产力
大数据
全栈老石3 小时前
拆解低代码引擎核心:元数据驱动的"万能表"架构
数据库·低代码
得物技术5 小时前
深入剖析Spark UI界面:参数与界面详解|得物技术
大数据·后端·spark
武子康6 小时前
大数据-238 离线数仓 - 广告业务 Hive分析实战:ADS 点击率、购买率与 Top100 排名避坑
大数据·后端·apache hive
倔强的石头_1 天前
kingbase备份与恢复实战(二)—— sys_dump库级逻辑备份与恢复(Windows详细步骤)
数据库
武子康1 天前
大数据-237 离线数仓 - Hive 广告业务实战:ODS→DWD 事件解析、广告明细与转化分析落地
大数据·后端·apache hive
大大大大晴天1 天前
Flink生产问题排障-Kryo serializer scala extensions are not available
大数据·flink
jiayou642 天前
KingbaseES 实战:深度解析数据库对象访问权限管理
数据库
李广坤3 天前
MySQL 大表字段变更实践(改名 + 改类型 + 改长度)
数据库
武子康3 天前
大数据-236 离线数仓 - 会员指标验证、DataX 导出与广告业务 ODS/DWD/ADS 全流程
大数据·后端·apache hive