服务端监控

机器监控核心指标

指标 这个指标是什么 主要监控场景 可以提前发现的问题
CPU使用率 > 80% CPU处理计算任务的繁忙程度。超过80%表示剩余计算能力不足20% 应用计算、请求处理、数据计算 请求排队、响应变慢、任务积压、服务超时
RSS内存使用率 > 80% RSS 全称是 Resident Set Size 即"常驻内存集",表示进程或容器当前实际占用的物理内存,包括堆内存、线程栈和部分堆外内存等,通常不包括已转移到Swap中的内存 应用、容器和进程的实际内存使用情况 内存泄漏、频繁GC、容器或进程被OOM杀死
Swap使用率 > 80% Swap是磁盘上的备用内存。物理内存不足时,系统会将暂时不用的数据放入Swap 物理内存不足或内存压力较大的机器 频繁内存换页、系统变慢、内存耗尽和OOM
系统负载 > 3 正在使用CPU、等待CPU或等待磁盘I/O的任务平均数量超过4 判断系统整体是否繁忙 CPU任务排队、磁盘阻塞、系统卡顿
磁盘繁忙率 > 10% 磁盘正在处理读写请求的时间占比超过10%,不是磁盘空间使用率 数据库、日志、文件读写、备份任务 磁盘I/O瓶颈、读写变慢、接口响应延迟
TCP连接数 > 3000,持续3分钟 TCP连接是客户端与服务器之间的网络通信通道,包括浏览器访问服务器、服务之间调用、应用连接数据库等。连接数不等于用户数 服务的并发连接情况 连接堆积、连接未释放、文件描述符耗尽、新连接失败
TCP重传数升高 TCP数据没有成功送达或没有及时收到确认时,系统重新发送数据的次数 浏览器与服务器、服务器与服务器之间的网络通信质量 网络丢包、网络拥塞、请求变慢和超时
网络流入速率 > 50 MB/s 机器每秒接收到的数据超过50 MB,相当于约400 Mbps 文件上传、数据同步、接口请求、消息消费 入站带宽占满、异常流量、网络拥塞
网络流出速率 > 50 MB/s 机器每秒发送出去的数据超过50 MB,相当于约400 Mbps 文件下载、接口响应、日志发送、数据同步 出口带宽占满、异常下载或数据传输
时间偏移 > 1000 ms 机器时间与标准时间源相差超过1秒 服务器时间同步 日志时间错乱、认证失败、定时任务异常、分布式系统数据错序
相关推荐
考虑考虑43 分钟前
nohup启动java程序
后端·自动化运维
aramae2 小时前
模拟实现strcmp()(C语言)
c语言·开发语言·后端
根目录下的猫4 小时前
RK3588适配的轻量级AI模型推荐
人工智能·后端·python·目标检测
星栈5 小时前
用 Rust 写 Agent 服务 -- adk-rust 上手记
后端·agent
杨运交5 小时前
[071][验证码模块]基于Spring拦截器的验证码认证设计思想
java·后端·spring
LucianaiB6 小时前
我用豆包工作 Seed-2.1-pro,复刻了 QQ 时代爆红的魔术图片
后端
码事漫谈6 小时前
智谱 ZCode 静默上传 Git 历史:48 小时信任危机复盘
后端
掘金码甲哥6 小时前
当对话模型遇上向量模型,vllm production stack 又该如何应对?
后端
传奇开心果编程7 小时前
【springboot基础语法学与练】第 1 课:从零开始
java·spring boot·后端·学习