从监控数据到告警管理:Prometheus与Alertmanager部署实战

文章目录


每日一句正能量

"在生活的起承转合中,神态自若,步伐坚定地去跋山涉水。"

人生天然的起伏------有开端、有延续、有转折、有收束。生活本就是需要体力与心力的远行,不是温室里的漫步。承认人生必有波折,但以稳得住的状态去穿越它。

前言

监控系统最基础的能力,是知道服务器发生了什么。但只有指标和曲线还不够,真正出现CPU持续升高、服务不可用或磁盘空间不足时,运维人员还需要及时识别异常,并判断哪些问题值得立即处理。

如果每次短暂波动都触发提醒,告警很快就会变成噪音。重复消息、缺少分级和无法集中管理,都会让人逐渐对警报失去敏感度,真正重要的问题反而容易被忽略。

Prometheus负责采集指标、执行查询并根据规则判断是否触发告警,Alertmanager则负责接收这些告警,进行分组、路由、静默和抑制。两者配合后,监控系统才具备从发现异常到管理告警的基本链路。

本文会在Ubuntu服务器中分别安装Prometheus与Alertmanager,将它们配置为systemd服务,再修改prometheus.yml,让Prometheus能够把触发的告警发送到本地9093端口。

本地监控页面运行正常后,还会安装 cpolar,将Prometheus的9090端口映射到公网,并配置固定二级子域名。这样运维人员离开局域网后,也能查看目标状态、规则和当前告警。

1.ubuntu安装prometheus实现监控部署

通过以下命令创建一个用于存放 Prometheus 的目录 /app:

shell 复制代码
mkdir /app

进入到/app目录下:

shell 复制代码
cd /app

从prometheus官网下载压缩文件:

下载适用于Linux系统的文件。

使用的是 MobaXterm_Personal,这是一种功能强大的终端工具,常用于远程连接 Linux 服务器。进入/app下面。点击上传,上传下载好的prometheus压缩文件。

解压缩该文件:

shell 复制代码
tar -xzvf prometheus-3.7.3.linux-amd64.tar.gz

将解压好的文件夹改一个名字,并删除原有的未解压文件(可以不删):

shell 复制代码
mv prometheus-3.5.0.linux-amd64 prometheus
rm -rf prometheus-3.5.0.linux-amd64.tar.gz

进入解压好并且改过名的prometheus目录下,查看它的版本。返回版本号代表安装成功!

shell 复制代码
cd /app/prometheus
./prometheus --version

创建prometheus 本地TSDB数据存储目录:

shell 复制代码
mkdir -p /var/lib/prometheus

进入这个目录,使用systemctl管理Prometheus:

shell 复制代码
vim /usr/lib/systemd/system/prometheus.service

写入:

shell 复制代码
[Unit]
Description=Prometheus
Documentation=https://prometheus.io/
After=network.target

[Service]
Type=simple
User=root
ExecStart=/app/prometheus/prometheus --config.file=/app/prometheus/prometheus.yml --storage.tsdb.path=/var/lib/prometheus --web.enable-lifecycle
ExecReload=/bin/kill -HUP $MAINPID
KillMode=process
Restart=on-failure

[Install]
WantedBy=multi-user.target
  • systemctl enable prometheus

    将 Prometheus 服务设置为 开机自启动。

  • systemctl start prometheus

    立即启动 Prometheus 服务。

  • systemctl status prometheus

    查看 Prometheus 服务的 当前状态。

shell 复制代码
systemctl enable prometheus 
systemctl start prometheus
systemctl status prometheus

部署完成后,在浏览器中输入 http://极空间IP:9090 就能看到prometheus的界面啦:

2.ubuntu安装alertmanager监控

去官网下载安装文件:

找到linux版,下载:

下载完成后记住下载路径。

手动上传到/app下载好的alertmanager文件。

上传成功后解压:

shell 复制代码
tar -vxzf alertmanager-0.27.0.linux-amd64.tar.gz

改名方便记忆:

shell 复制代码
mv alertmanager-0.27.0.linux-amd64 alertmanager

将Altermanager配置为系统服务:

shell 复制代码
cd /usr/lib/systemd/system
shell 复制代码
vim alertmanager.service
shell 复制代码
[Unit]
Description=https://prometheus.io

[Service]
Restart=on-failure
ExecStart=/app/alertmanager --config.file=/app/alertmanager.yml

[Install]                      
WantedBy=multi-user.target

加载system文件,启动alertmanager这个服务,并设置开机启动:

shell 复制代码
systemctl daemon-reload
systemctl start alertmanager.service
systemctl enable alertmanager.service

也可以后台手动启动:

shell 复制代码
nohup ./alertmanager --config.file=alertmanager.yml >> /app/alertmanager/alertmanager/alertmanager.out 2>&1 &
cat alertmanager.out

启动成功后,访问Altermanager,ip+9093,默认端口为 9093。

3.在prometheus上配置alertmanagerg告警

进入prometheus的配置文件,加入alertmanager告警规则:

shell 复制代码
vi /app/prometheus/prometheus.yml

Bash

加入以下内容后:Prometheus可以用localhost:9093访问到运行在本地9093端口的Alertmanager服务,从而抓取系统指标。

shell 复制代码
      - targets: ["localhost:9093"]
        labels:
          app: "alertmanager"

Bash

这一步配置的作用是:告诉 Prometheus,当监控规则触发告警时,应该把告警信息发送到哪个 Alertmanager 服务进行处理(便于一会监控node_exporter,也可以监控mysqld_exporter等等)。

shell 复制代码
alerting:
  alertmanagers:
    - static_configs:
        - targets: ["localhost:9093"]

打开prometheus监控成功:

后续也可以配置告警规则。

但是目前我们只能在自己电脑上进行监控,倘若公司有一个紧急警报,我们能怎么做呢?接下来,cpolar就派上永场啦!

4.安装cpolar实现随时随地开发

cpolar 可以将你本地电脑中的服务(如 SSH、Web、数据库)映射到公网。即使你在家里或外出时,也可以通过公网地址连接回本地运行的开发环境。

❤️以下是安装cpolar步骤:

使用一键脚本安装命令:

shell 复制代码
sudo curl https://get.cpolar.sh | sh

安装完成后,执行下方命令查看cpolar服务状态:(如图所示即为正常启动)

shell 复制代码
sudo systemctl status cpolar

Cpolar安装和成功启动服务后,在浏览器上输入虚拟机主机IP加9200端口即:【http://ip:9200】访问Cpolar管理界面,使用Cpolar官网注册的账号登录,登录后即可看到cpolar web 配置界面,接下来在web 界面配置即可:

打开浏览器访问本地9200端口,使用cpolar账户密码登录即可,登录后即可对隧道进行管理。

5.配置公网地址

登录cpolar web UI管理界面后,点击左侧仪表盘的隧道管理------创建隧道:

  • 隧道名称:可自定义,本例使用了:prometheus,注意不要与已有的隧道名称重复

  • 协议:http

  • 本地地址:9090

  • 域名类型:随机域名

  • 地区:选择China Top

    点击创建:

创建成功后,打开左侧在线隧道列表,可以看到刚刚通过创建隧道生成了公网地址,接下来就可以在其他电脑或者移动端设备(异地)上,使用地址访问。

访问成功。

6.保留固定公网地址

使用cpolar为其配置二级子域名,该地址为固定地址,不会随机变化。

点击左侧的预留,选择保留二级子域名,地区选择china top,然后设置一个二级子域名名称,我这里演示使用的是prometheus,大家可以自定义。填写备注信息,点击保留。

登录cpolar web UI管理界面,点击左侧仪表盘的隧道管理------隧道列表,找到所要配置的隧道prometheus,点击右侧的编辑

修改隧道信息,将保留成功的二级子域名配置到隧道中

  • 域名类型:选择二级子域名
  • Sub Domain:填写保留成功的二级子域名
  • 地区: China Top

点击更新

更新完成后,打开在线隧道列表,此时可以看到随机的公网地址已经发生变化,地址名称也变成了保留和固定的二级子域名名称。

最后,我们使用固定的公网地址在任意设备的浏览器中访问,可以看到成功访问本地部署的prometheus页面,这样一个永久不会变化的二级子域名公网网址即设置好了。

这样,我们就可以随时随地监控,不用担心,在家无法监控设备!

总结

完成部署以后,Prometheus负责保存指标并评估告警条件,Alertmanager负责接收和整理告警信息,两套服务也都交由systemd管理,可以随系统启动并在异常退出后重新运行。

需要注意的是,仅把Alertmanager地址写入Prometheus配置,并不代表完整告警体系已经建立。还需要配置具体规则文件、严重级别、持续时间,以及邮件、企业微信、Webhook等实际通知接收方式。

告警阈值不能完全照搬示例。CPU瞬时升高和持续占用的处理优先级不同,磁盘、内存和服务可用性也需要结合业务特点设置合理的for时间,避免短暂抖动造成无效提醒。

通过 cpolar 映射9090端口后,可以在外部网络查看Prometheus页面,但这解决的是远程管理问题,并不等同于告警会主动发送到手机。真正的通知能力仍由Alertmanager接收器配置决定。

Prometheus和Alertmanager管理页面中可能包含服务器地址、任务名称、告警规则和运行状态,不应直接公开。固定二级子域名方便长期访问,同时也应配合强密码、访问控制和必要的网络隔离。

Prometheus负责发现异常,Alertmanager负责让告警更有秩序,cpolar负责补上远程查看入口。整套方案的目标不是让警报变得更多,而是让真正需要处理的问题更清楚、更及时地到达正确的人。


转载自:https://blog.csdn.net/u014727709/article/details/163239684

欢迎 👍点赞✍评论⭐收藏,欢迎指正

相关推荐
Livia要学习1 天前
Prometheus架构解析
prometheus
winfreedoms1 天前
VMware 桥接模式无法联网:从 DHCPDISCOVER 到静态 IP 的完整排障实战
网络协议·tcp/ip·ubuntu·桥接模式·vmware·嵌入式学习
静止了 所有的花开2 天前
Ubuntu 26.04 静态 IP 配置不生效解决方法
linux·ubuntu·静态ip
云烟成雨TD2 天前
Micrometer 系列【63】统一观测:基于 Spring Boot 的生产级演示案例 | 基于 OTLP 集成 Prometheus + Jaeger
spring boot·云原生·prometheus
池央2 天前
飞牛OS部署ExerciseDiary:搭建个人运动训练记录服务
cpolar
拾光Ծ2 天前
【Linux网络】数据链路层详解:以太帧与ARP协议 + 代理服务器与内网穿透,内网打洞
计算机网络·内网穿透·数据链路层·arp·代理服务器·内网打洞·以太帧
桑榆4163 天前
双系统(Windows + Ubuntu)安装流程
linux·windows·ubuntu
sunly_3 天前
TypeScript:3、类型声明与类型推断
javascript·ubuntu·typescript
wengqidaifeng3 天前
1.从“会敲命令”到理解 Linux:15 个基础指令、文件树与命令执行的本质
linux·运维·服务器·ubuntu
问天_观心3 天前
虚拟环境WSL之Ubuntu的安装
人工智能·ubuntu