监控基本概念

监控:这个词在不同的上下文中有不同的含义,在讲到监控MySQL或者监控Redis时,这里只涉及数据采集和可视化,不涉及告警引擎和事件处理。要是监控系统的话,不但包括数据采集和可视化,而且也包括告警和事件发送等相关功能。

监控指标:数值类型的监控数据

监控指标三种典型的描述方式:

1.全局唯一字符串作为指标标识。

2.标签集的组合作为指标标识

3.优雅高效的 Influx 指标格式

监控系统核心两个核心能力:监控和告警

指标类型:RRDtool 还提出了数据类型的概念,支持 GAUGE、COUNTER、DERIVE、DCOUNTER、DDERIVE、ABSOLUTE 等多种数据类型。Prometheus 生态也支持数据类型,分为 Gauge、Counter、Histogram、Summary等4 种。

Gauge:测量值类型,可大可小,可正可负,通常关注的是当前值。

Counter:表示单调递增的值,比如操作系统自启动以来网卡接收到的所有流量包的数量。

Histogram:直方图类型,用于描述数据分布,最典型的应用场景就是监控延迟数据。

Summary:在客户端计算分位值,然后把计算之后的结果推给服务端存储,展示的时候直接查询即可。

划分指标类型最主要的作用:在采集侧埋点的时候,SDK 会根据数据类型做不同的计算逻辑。

时序库:专门处理时序数据的数据库,英文全称为Time series database。

时序数据最大的特点:每一条数据都带有时间戳,通常是单调顺序,不会乱序,流式发给服务端,通常不会修改。

告警收敛:让告警事件变少的方法。

告警闭环:最终被解决,告警恢复。

此文章为9月Day 6学习笔记,内容来源于极客时间《运维监控系统实战笔记》

相关推荐
Lsir10110_3 分钟前
【Linux】进程信号(下半)
linux·运维·服务器
skywalk816320 分钟前
unbound dns解析出现问题,寻求解决之道
运维·服务器·dns·unbound
酉鬼女又兒21 分钟前
零基础入门Linux指南:每天一个Linux命令_pwd
linux·运维·服务器
云飞云共享云桌面23 分钟前
高性能图形工作站的资源如何共享给10个SolidWorks研发设计用
linux·运维·服务器·前端·网络·数据库·人工智能
skywalk816325 分钟前
走近科学:unbound dns域名服务器自己本地解析出现问题,寻求解决之道
运维·服务器·dns·unbound
袁煦丞 cpolar内网穿透实验室29 分钟前
远程调试内网 Kafka 不再求运维!cpolar 内网穿透实验室第 791 个成功挑战
运维·分布式·kafka·远程工作·内网穿透·cpolar
AZ996ZA40 分钟前
自学linux的第二十一天【DHCP 服务从入门到实战】
linux·运维·服务器·php
神梦流2 小时前
GE 引擎的非标准数据流处理:稀疏张量与自定义算子在图优化中的语义保持
linux·运维·服务器
兜兜转转了多少年2 小时前
从脚本到系统:2026 年 AI 代理驱动的 Shell 自动化
运维·人工智能·自动化
Lsir10110_3 小时前
【Linux】中断 —— 操作系统的运行基石
linux·运维·嵌入式硬件