prometheus

A心有千千结1 天前
nginx·prometheus·devops
Nginx网关可观测建设:打通流量入口,加速线上故障诊断Nginx 通常守在业务系统最前面,反向代理、负载均衡、TLS 卸载、缓存和限流这些活儿,很多都要经过它。用户访问慢了、接口报错了,或者后端服务不可用了,请求往往也都会先经过 Nginx。
天天喝旺仔2 天前
容器·kubernetes·grafana·prometheus·时序数据库
Prometheus + Grafana 监控告警体系搭建实战:从 Exporter 指标采集、PromQL 查询到 Alertmanager 告警落地摘要:本文以一套可运行的 Prometheus + Grafana 监控告警体系为主线,覆盖 Exporter 指标采集、PromQL 查询、告警规则与 Alertmanager 通知落地,最后用 Grafana 出图并给出 docker-compose 一键部署与生产建议,帮助运维与开发搭建自己的可观测性底座。
川石课堂软件测试6 天前
网络协议·测试工具·jmeter·http·单元测试·postman·prometheus
涨薪技术|Prometheus之HTTP API中使用PromQLPrometheus当前稳定的HTTP API可以通过/api/v1访问。Prometheus API使用了JSON格式的响应内容。 当API调用成功后将会返回2xx的HTTP状态码。反之,当API调用失败时可能返回以下几种不同的HTTP状态码:
IT界的老黄牛7 天前
prometheus·时序数据库·监控·thanos·victoriametrics·remote_write
Prometheus TSDB 拆不出来、也存不了一年:4 条外部存储出路 + 容量测算📝 摘要:读者问:Prometheus 的 TSDB 能独立部署吗?存更多数据有限制吗?答案是不能——TSDB 是嵌入式库,data 目录一个 lock 文件就挡住了双进程,官方明确「不集群、不副本、不支持 NFS」。但存储能换。本文含 TSDB 写入路径、官方公式算出「50 万 series 存 90 天要 518 GB」、remote_write 三个必踩的坑(远端挂 2 小时就永久丢数据),以及加盘 / VictoriaMetrics / Thanos / Mimir 四条路怎么选。
Ningcode_cloud7 天前
云原生·k8s·prometheus
Kubernetes 弹性伸缩实验手册:从集群搭建到 HPA / VPA 自动扩缩容📌 实验实录:2026-09-07(基础环境预置)~ 2026-09-08(集群部署与全部弹性伸缩实验),全程在真实三节点 Kubernetes 集群上完成。 说明:本文全部操作命令与输出均取自实验终端实录,命令提示符保留操作时刻(如 [root@master ~ 09:07:37]#);实验过程中排除掉的无效尝试不在正文出现,其中具有教学价值的排障内容统一整理进对应章节与文末 FAQ。
2601_962097369 天前
grafana·prometheus·微服务架构·可观测性·opentelemetry
可观测性实战:Prometheus+Grafana+OTel构建监控在微服务的架构情形之下, 系统被拆分成为, 数十个甚至, 又或者可达到上百个独立的服务, 一次用户的请求之时, 有可能会跨越若干个服务节点啊。当线上一旦察觉出现响应速度变迟缓, 以及错误率急剧飙升的状况之时, 传统的那种单机监控方式, 已是根本没有办法可以回答诸如, “请求到底卡在哪一跳”, “哪一个服务才是导致瓶颈产生的根源”, “错误究竟是从哪里传播过来的”, 这些极为关键重要的问题。而可观测性,它, 是借助指标、日志、追踪这三大支柱, 从而使得团队能够凭借从外部输出的内容去推断系统内部的状态。本文,
IT界的老黄牛9 天前
jenkins·grafana·prometheus·监控·ci-cd·告警规则
Jenkins 监控一条龙:接入、看板 9964、11 条告警规则直接抄走📝 摘要:给 Jenkins 配一套完整监控,一条龙走完四步:装 Prometheus metrics 插件接入(两行配置,⚠️ 指标名前缀可配,照抄网上的多半对不上你的)、导 Grafana 看板 9964(19 个面板逐块实测,4 个 No data、1 个数是错的都标出来了)、11 条告警规则(从 Jenkinsfile 反模式反推,不是照指标列表堆的;已过 promtool 校验并真实加载运行)、以及配完之后怎么用两分钟确认它们不是哑弹。
陈皮糖..9 天前
运维·docker·性能优化·架构·云计算·prometheus
基于 Keepalived 的传统 Web 高可用架构的容器化改造与可观测性升级搭建一套生产级高可用、读写分离、可观测的 Web 业务系统。当主业务节点(Node-1)的 Tomcat 故障时,VIP 自动漂移到备节点(Node-2),保障查询业务不中断;同时通过 Prometheus 监控栈对核心组件进行告警。
heimeiyingwang10 天前
prometheus
【Prometheus·部署篇】存储与容量规划:本地存储、远程存储与长期保存Prometheus 默认只适合短期存储(15-30 天)。但企业往往需要保存数月甚至数年的监控数据用于趋势分析和合规审计。本篇深入 TSDB 存储机制、容量规划、远程存储方案和 Thanos 长期存储。
heimeiyingwang10 天前
grafana·prometheus
【Prometheus·可视化篇】Grafana 集成:数据源配置与 Dashboard 设计原则Prometheus 的数据是文本和 JSON,直接看不直观。Grafana 是最流行的可视化平台,与 Prometheus 天然搭档。本篇讲解 Grafana 的安装、数据源配置和 Dashboard 设计原则。
IT界的老黄牛10 天前
jenkins·maven·prometheus·告警·排查·ci-cd
Jenkins 构建卡了 23 天,abort 按钮点了没用📝 摘要:一条告警说某个构建跑了 23 天。可打开 Jenkins——0 of 2 executors busy、队列是空的、模块没一个显示「构建中」、上次构建 2 秒就成功了,四个地方都说「没有构建在跑」,我一度判定「指标坏了」,这个判断是错的。它藏在 Maven 模块页,连构建丢弃策略都放过了它,理由是「it is still running」:靠「还在运行」躲过清理,又靠躲过清理继续「运行」。而红叉点下去纹丝不动,往下每层标准做法也依次失效。本文有完整追查、从容器日志挖出的根因,和真正收得掉它的办
heimeiyingwang12 天前
prometheus
【Prometheus·告警篇】告警规则:Recording Rules 与 Alerting Rules 最佳实践Prometheus 的规则分为两类:Recording Rules(预计算指标)和 Alerting Rules(告警规则)。写好规则是做监控告警的核心技能。本篇详解两类规则的语法、设计原则和常见模式。
AAA@峥13 天前
云原生·grafana·prometheus
从零搭建 Prometheus 完整监控告警体系|Linux 部署 + node_exporter+Grafana 可视化摘要:本文从零开始搭建一套完整的 Prometheus 监控告警体系。首先介绍 Prometheus 的核心概念、组件与架构,随后详细演示在 Linux 上部署 Prometheus 服务端,并通过 node_exporter 实现对本地及远程主机的监控,最后接入 Grafana 完成数据的可视化展示,帮助读者快速掌握云原生监控的落地实践。
liuyicenysabel14 天前
javascript·grafana·prometheus
Grafana + Prometheus 分级告警配置设计(P0/P1/P2)一套生产常用的 P0/P1/P2 分级告警设计。分级原则:P0=服务真没了、P1=资源告急快出事、P2=趋势预警早点看。按"越严重:报警越即时、抑制越短、通知越显眼"来配。
随遇而安zx14 天前
spring cloud·grafana·prometheus
SpringCloud---可观测性与监控:Actuator / Micrometer / Prometheus / Grafana 深度解析基于:Spring Boot 3.5.x(示例兼容 4.x,配 Micrometer 1.15)/ Prometheus 3.x / Grafana 13.2
qq_4523962314 天前
服务发现·prometheus
第四篇:《Prometheus 深度实战:指标设计、Exporter 开发与服务发现》在前三篇文章中,我们建立了可观测性的理论框架,理解了 LGTM 栈的整体架构,并掌握了 OpenTelemetry 的统一插桩标准。但指标监控的“最后一公里”仍然需要深入 Prometheus——它是云原生指标监控的事实标准,也是 LGTM 栈中 Mimir 的数据来源。本文从 Prometheus 的核心架构出发,系统讲解四种指标类型的设计与使用场景、Exporter 开发实战、以及 Kubernetes 服务发现配置,帮你掌握从“指标设计”到“指标采集”的完整技能。
刘某的Cloud14 天前
linux·运维·kubernetes·prometheus·监控
k8s部署prometheus架构规则Prometheus Operator 架构中的四个核心资源对象,它们之间是**“采集 → 规则 → 告警 → 通知”**的完整链路关系。下面为你详解每个资源的逻辑包含关系、作用及示例。
LlmCraft|大模型工程实践15 天前
elk·docker·prometheus
12. Docker 日志管理与监控:ELK 日志收集 + Prometheus 性能监控容器跑着跑着突然挂了,你慌忙打开终端——日志在哪看?10 个容器同时出问题,你要一个一个 docker logs 去翻?服务器 CPU 飙到 90%,到底是哪个容器在作妖?搞容器,不看日志和监控,就等于闭着眼睛开车。 本文手把手带你搭建两套"生产级"方案:ELK 集中收集日志 + Prometheus/Grafana 实时监控容器性能,看完你就是团队里的"容器运维担当"。
DevOps老兵15 天前
人工智能·grafana·prometheus·ai infra·gpu监控·dcgm
AI Infra实战02:GPU监控实战,用DCGM+Prometheus+Grafana看清每一张卡本篇配套的全部脚本、YAML、Helm Chart、预检工具和 Terraform 配置已开源在 GitHub:https://github.com/Jich1123/gpu-k8s-lab 。clone 下来按 00-lab/execution-checklist.md 的顺序执行即可复现全部实验(仓库不含任何真实 IP、密钥或账号信息)。
heimeiyingwang15 天前
prometheus
【Prometheus·入门篇】数据模型:Metric 类型、标签与时间序列Prometheus 的核心是时间序列数据。理解它的数据模型——指标类型、标签、时间序列——是写好 PromQL 和做好监控的前提。本篇深入讲解数据模型的每个细节。