大数据之LibrA数据库系统告警处理(ALM-12027 主机PID使用率超过阈值)

告警解释

系统每30秒周期性检测PID使用率,并把实际PID使用率和阈值进行比较,PID使用率默认提供一个阈值。当检测到PID使用率超出阈值时产生该告警。

平滑次数为1,主机PID使用率小于或等于阈值时,告警恢复;平滑次数大于1,主机PID使用率小于或等于阈值的90%时,告警恢复。

告警属性
告警ID 告警级别 可自动清除
12027 严重
告警参数
参数名称 参数含义
ServiceName 产生告警的服务名称。
RoleName 产生告警的角色名称。
HostName 产生告警的主机名。
Trigger Condition 系统当前指标取值满足自定义的告警设置条件。
对系统的影响

无法分配PID给新的业务进程,业务进程不可用。

可能原因
  • 节点同时运行的进程过多,需要扩展pid_max值。
  • 系统环境异常。
处理步骤

扩展pid_max值。

  1. 打开FusionInsight Manager页面,在实时告警列表中,单击此告警。在"告警详情"区域,获取告警所在主机IP地址。

  2. 使用PuTTY工具,以root用户登录告警所在主机。

  3. 执行命令cat /proc/sys/kernel/pid_max,查看系统当前运行的PID最大值pid_max。

  4. 若PID使用率超过阈值,将pid_max值增大一倍,执行命令echo 新pid_max > /proc/sys/kernel/pid_max

    示例:echo 65536 > /proc/sys/kernel/pid_max

  5. 等待5分钟,检查该告警是否恢复。

    • 是,处理完毕。
    • 否,执行[步骤 6](#步骤 6)。

检查系统环境是否异常。

  1. 联系操作系统维护人员,检查操作系统是否存在异常。

    • 是,恢复操作系统故障,执行[步骤 7](#步骤 7)。
    • 否,执行[步骤 8](#步骤 8)。
  2. 等待5分钟,检查该告警是否恢复。

    • 是,处理完毕。
    • 否,执行[步骤 8](#步骤 8)。

收集故障信息。

  1. 在主集群的FusionInsight Manager界面,单击"系统设置 > 日志下载"。
  2. 在"服务"下拉框中勾选"所有服务",单击"确定"。
  3. 设置日志收集的"开始时间"和"结束时间"分别为告警产生时间的前后30分钟,单击"下载"。
相关推荐
天宇&嘘月5 小时前
Nginx的https搭建
网络·nginx·https
_星辰大海乀5 小时前
IP 协议
服务器·网络·tcp/ip·nat·子网掩码·ip协议
屿行屿行6 小时前
【Linux】Socket编程(基于实际工程分析)
linux·服务器·网络
赞奇科技Xsuperzone6 小时前
【首发】DGX Spark 三机互连跑 Qwen3-235B-A22B-FP8!
大数据·分布式·spark
runepic6 小时前
Python + PostgreSQL 批量图片分发脚本:分类、去重、断点续拷贝
服务器·数据库·python·postgresql
天才程序YUAN6 小时前
从零开始、保留 Windows 数据、安装Ubuntu 22.04 LTS双系统
linux·windows·ubuntu
Evan芙6 小时前
Rocky Linux 9 网卡改名及静态IP地址配置完整步骤
linux·网络·智能路由器
Zeku6 小时前
20251125 - 韦东山Linux第三篇笔记【上】
linux·笔记·单片机
企鹅侠客7 小时前
Linux性能调优 详解磁盘工作流程及性能指标
linux·运维·服务器·性能调优
icy、泡芙7 小时前
TF卡---热插拔
linux·驱动开发