grafana

蓝胖的四次元口袋5 天前
grafana·prometheus
Prometheus+Grafana知识梳理(2)作者:没有四次元口袋的蓝胖 日期:2026-10-1 标签:Grafana, 监控体系Prometheus 自带一个简陋的 Web UI(http://localhost:9090),只适合调试 PromQL 表达式。真正的生产环境可视化全靠 Grafana——一个开源的数据可视化平台,支持多种数据源,通过 Dashboard 面板将时序数据变成直观可读的图表。
打工仔折腾 AI6 天前
服务器·人工智能·后端·python·性能优化·django·grafana
多台服务器日志分散难查?用Promtail+Loki+Grafana搭建集中检索平台线上服务一旦拆到多台机器,日志查询就会变成一件很烦的事。我维护的几个后端服务分布在四台服务器上,平时排查问题基本靠 ssh 登上去,再 tail -f 或者 grep。单机还好,一旦某个请求跨了多个服务,或者要对比几台机器同一时间段的报错,就得开好几个终端来回切,效率低到让人怀疑人生。
蓝胖的四次元口袋8 天前
grafana·prometheus
Prometheus+Grafana知识梳理(1)作者:没有四次元口袋的蓝胖 日期:2026-09-30 标签:Prometheus, 监控体系监控系统是后端架构中不可或缺的一环。在微服务时代,没有监控就等于裸奔——服务挂了不知道、性能瓶颈找不到、容量规划靠猜。Prometheus 是目前最主流的开源监控方案,几乎所有中大型公司都在用,也是 Kubernetes 生态的标配监控组件。
哈__9 天前
运维·服务器·grafana
日志散在多台服务器怎么查?用 Promtail + Loki + Grafana 搭一套集中检索平台应用出错时,我最怕的不是看到一条报错,而是明知道异常发生了,却不知道该去哪台机器、哪个目录找它。登录服务器、翻 server.log、对照时间,再切到另一套服务继续查,日志越分散,定位问题花的时间就越多。Promtail、Loki 和 Grafana 这套 PLG 组合适合解决的,正是把日志采集、存储和查询分成三个明确的环节:Promtail 盯住文件并发送日志,Loki 按标签组织日志流,Grafana 则提供查询与展示入口。它不等于把所有日志都建成全文索引,查问题时要先选对标签,再用 LogQL 缩小
DylanlZhao21 天前
llm·grafana
我想看看本地 LLM 给我省了多少钱,于是我监控了它最近大量用本地模型,我想知道我每天到底省了多少钱。所以我就必须要知道我每天用了多少 tokens。于是我就问 AI,怎么才能监听本地大模型的用量?
天天喝旺仔23 天前
容器·kubernetes·grafana·prometheus·时序数据库
Prometheus + Grafana 监控告警体系搭建实战:从 Exporter 指标采集、PromQL 查询到 Alertmanager 告警落地摘要:本文以一套可运行的 Prometheus + Grafana 监控告警体系为主线,覆盖 Exporter 指标采集、PromQL 查询、告警规则与 Alertmanager 通知落地,最后用 Grafana 出图并给出 docker-compose 一键部署与生产建议,帮助运维与开发搭建自己的可观测性底座。
qq_452396231 个月前
java·贪心算法·grafana
第十二篇:《数据采集:Grafana Alloy、Fluent Bit、Vector 的选型与配置》在前十一篇文章中,我们分别搭建了 LGTM 栈的各个组件,并学习了 eBPF 的零侵扰观测能力。但所有可观测性数据都面临同一个问题:如何从分散的服务中采集并发送到正确的后端?数据采集是连接“数据源”和“可观测性后端”的桥梁,它的设计直接影响数据的完整性、实时性和成本。本文从数据采集的通用架构出发,系统对比 Grafana Alloy(一站式)、Fluent Bit(轻量级日志)、Vector(高性能管道)三大采集工具,并通过 Kubernetes 实战帮你选出最合适的采集方案。
2601_962097361 个月前
grafana·prometheus·微服务架构·可观测性·opentelemetry
可观测性实战:Prometheus+Grafana+OTel构建监控在微服务的架构情形之下, 系统被拆分成为, 数十个甚至, 又或者可达到上百个独立的服务, 一次用户的请求之时, 有可能会跨越若干个服务节点啊。当线上一旦察觉出现响应速度变迟缓, 以及错误率急剧飙升的状况之时, 传统的那种单机监控方式, 已是根本没有办法可以回答诸如, “请求到底卡在哪一跳”, “哪一个服务才是导致瓶颈产生的根源”, “错误究竟是从哪里传播过来的”, 这些极为关键重要的问题。而可观测性,它, 是借助指标、日志、追踪这三大支柱, 从而使得团队能够凭借从外部输出的内容去推断系统内部的状态。本文,
Joker-Full-stack1 个月前
bug·grafana·higress
higress Grafana生产事故复盘:Loki 2.9 WAL 竞态 Bug 导致 5 天审计日志消失一次 Grafana 看板上的"Token 曲线空洞",引出了 Loki 2.9.0 的 WAL checkpoint 竞态 Bug。数据进了 Ingester 却从未落盘,105,633 行日志"人间蒸发"。本文完整记录了从发现异常、10 步证据链排查、根因定位、升级到 3.7.1、数据回灌到自愈脚本落地的全过程。
IT界的老黄牛1 个月前
jenkins·grafana·prometheus·监控·ci-cd·告警规则
Jenkins 监控一条龙:接入、看板 9964、11 条告警规则直接抄走📝 摘要:给 Jenkins 配一套完整监控,一条龙走完四步:装 Prometheus metrics 插件接入(两行配置,⚠️ 指标名前缀可配,照抄网上的多半对不上你的)、导 Grafana 看板 9964(19 个面板逐块实测,4 个 No data、1 个数是错的都标出来了)、11 条告警规则(从 Jenkinsfile 反模式反推,不是照指标列表堆的;已过 promtool 校验并真实加载运行)、以及配完之后怎么用两分钟确认它们不是哑弹。
heimeiyingwang1 个月前
grafana·prometheus
【Prometheus·可视化篇】Grafana 集成:数据源配置与 Dashboard 设计原则Prometheus 的数据是文本和 JSON,直接看不直观。Grafana 是最流行的可视化平台,与 Prometheus 天然搭档。本篇讲解 Grafana 的安装、数据源配置和 Dashboard 设计原则。
2601_962097361 个月前
python·grafana·数据可视化·graphql·dash
GraphQL,Grafana和Dash要是您属于对着数据科学, 以及数据处理, 或者数据可视化有着兴趣的那类人, 那么这篇文章便是适合您的选择。我肯定您已然听闻过我在上面提到的主题这儿所用的名称。在这篇文章当中, 我会先去详尽地讲述全部这些内容, 之后再开展比较。
happymade1 个月前
运维·服务器·网络·zabbix·grafana·msrm3
7000 台网络设备批量纳管 & 自动拓扑生成实战——MSRM3 完整操作流程与关键要点复盘作者按:最近接手了一个 7000+ 台设备的大规模组网项目,路由器、交换机、无线 AC、AP 加起来网络架构相当复杂。用传统方式手工画拓扑、逐个 IP 加设备,工作量根本不敢想。这篇文章把这次实测中「批量发现 → 自动拓扑 → AP 挂载 → 布局优化 → 告警定位」的完整链路复盘一遍,把每一步的关键配置项、容易踩的坑、以及最后呈现的效果都写清楚,供同样在做大网运维的同学参考。
AAA@峥1 个月前
云原生·grafana·prometheus
从零搭建 Prometheus 完整监控告警体系|Linux 部署 + node_exporter+Grafana 可视化摘要:本文从零开始搭建一套完整的 Prometheus 监控告警体系。首先介绍 Prometheus 的核心概念、组件与架构,随后详细演示在 Linux 上部署 Prometheus 服务端,并通过 node_exporter 实现对本地及远程主机的监控,最后接入 Grafana 完成数据的可视化展示,帮助读者快速掌握云原生监控的落地实践。
liuyicenysabel1 个月前
javascript·grafana·prometheus
Grafana + Prometheus 分级告警配置设计(P0/P1/P2)一套生产常用的 P0/P1/P2 分级告警设计。分级原则:P0=服务真没了、P1=资源告急快出事、P2=趋势预警早点看。按"越严重:报警越即时、抑制越短、通知越显眼"来配。
随遇而安zx1 个月前
spring cloud·grafana·prometheus
SpringCloud---可观测性与监控:Actuator / Micrometer / Prometheus / Grafana 深度解析基于:Spring Boot 3.5.x(示例兼容 4.x,配 Micrometer 1.15)/ Prometheus 3.x / Grafana 13.2
DevOps老兵1 个月前
人工智能·grafana·prometheus·ai infra·gpu监控·dcgm
AI Infra实战02:GPU监控实战,用DCGM+Prometheus+Grafana看清每一张卡本篇配套的全部脚本、YAML、Helm Chart、预检工具和 Terraform 配置已开源在 GitHub:https://github.com/Jich1123/gpu-k8s-lab 。clone 下来按 00-lab/execution-checklist.md 的顺序执行即可复现全部实验(仓库不含任何真实 IP、密钥或账号信息)。
qq_452396231 个月前
grafana
第二篇:《LGTM 栈全景:Loki、Grafana、Tempo、Mimir 的协同作战》在上一篇文章中,我们理解了可观测性三大支柱的定义与演进。但知道“需要什么”和“怎么搭建”之间还有一条鸿沟。LGTM 栈正是填平这条鸿沟的答案——它由 Grafana Labs 打造,是开源可观测性领域唯一一个覆盖日志、指标、链路追踪三大支柱的一体化解决方案。本文从 LGTM 栈的定位出发,深入剖析 Loki、Tempo、Mimir 三大后端存储的设计哲学,以及 Grafana 作为统一查询入口的集成能力,并通过 Docker Compose 实战带你亲手搭建一套完整的可观测性平台。
白鲸开源1 个月前
开源·grafana·监控
DolphinScheduler 挂了你不知道?Prometheus + Grafana 监控兜底方案,亲测可用你有没有经历过这样的场景:DolphinScheduler 默默挂了半天,任务全部停摆,结果你还在工位上优哉游哉喝咖啡,直到老板冲过来问"数据怎么还没更新"——那一刻,你的表情大概和线上服务一样,卡住了。
mmsy10241 个月前
grafana
Grafana 使用文档适用版本:Grafana 13.x(当前最新 13.2.0;12.x 引入 Observability as Code、Drilldown 下钻体验、Git 同步等重大变化,文档均覆盖)。 本文覆盖:安装部署、数据源、仪表盘与面板、变量模板、统一告警、权限、API/Provisioning、Explore 关联、插件生态与最佳实践。