云原生k8s【第七课】:集群监控与可观测性

第 18 章 集群监控与可观测性

1、可观测性三个核心维度

  1. Metrics指标:CPU、内存这类数字数据,用来做告警、自动扩缩容。
  2. Logging日志:程序输出的文字报错,排查故障使用。
  3. Tracing链路追踪:追踪一次请求完整经过哪些服务,用来找性能慢的问题。

2、metrics‑server

轻量级组件,不保存历史数据,只保留近期资源快照。给kubectl top查看资源占用、HPA 水平自动扩缩容提供数据来源。

3、Prometheus 监控体系

Prometheus 采用拉取模式,主动去找各个组件拿监控数据。

  • Node Exporter:部署在每台节点机器,采集服务器硬件指标(CPU、内存、磁盘)。
  • Kube‑State‑Metrics:把 K8s 内部 Pod、Deployment 等资源状态转换成监控指标。
  • Prometheus Operator:用 CRD 自定义资源管理 Prometheus,配置写 yaml 文件。

4、Prometheus 与 Grafana 分工

  • Prometheus:负责收集、存储监控数据。
  • Grafana:本身不存监控数据,负责把数据渲染成图表展示。
  • 工作流程:Grafana 发送 PromQL 查询 → Prometheus 返回数据 → Grafana 画出图表。

Grafana 主要概念:

  1. 数据源:对接 Prometheus、Loki 等存储,统一获取数据。
  2. 仪表盘面板:放监控图表,可以手写查询语句,也能导入网上现成模板。
  3. 告警:设置指标阈值,异常把消息推送到钉钉、企业微信。

5、日志方案 Loki + Promtail

  • Loki:日志存储服务,保存收集上来的日志。
  • Promtail:部署在每个节点,采集本机 Pod 日志,上报给 Loki。

整体链路:Promtail采集日志 → Loki存储 → Grafana查看

相关推荐
未济5 天前
linux 配置环境变量
linux
傲世仙尊5 天前
目录即文件-Ext文件系统收尾篇
linux·c语言
虎头金猫5 天前
4K 视频总卡在公网带宽?用 N1 + OpenList 把网盘播放链路重新理顺
运维·服务器·网络·python·容器·beautifulsoup·pandas
分布式存储与RustFS5 天前
MinIO 官方 Docker 镜像被移除:依赖它的项目该怎么办
docker·云原生·devops·对象存储·minio·分布式存储
_艾伦 耶格尔.5 天前
进程间通信
linux
AI职业加油站5 天前
AI智能体应用工程师证书:政策红利下的职业新风口
大数据·运维·人工智能·学习·职场发展
codeejun5 天前
每日一Go·MySQL-5、锁机制全解析
云原生·golang
Liuqy-055 天前
Linux IO编程——静态库、动态库
linux
此冬歌咏5 天前
K8s 节点故障实战:优雅驱逐 31 秒,硬故障 331 秒,以及那个永远 Pending 的 Pod
运维·k8s
彧azz5 天前
Linux 环境下 Redis 学习总结:数据类型、持久化、锁、事务、主从与缓存问题
linux·redis·笔记·学习·面试