服务端监控

机器监控核心指标

指标 这个指标是什么 主要监控场景 可以提前发现的问题
CPU使用率 > 80% CPU处理计算任务的繁忙程度。超过80%表示剩余计算能力不足20% 应用计算、请求处理、数据计算 请求排队、响应变慢、任务积压、服务超时
RSS内存使用率 > 80% RSS 全称是 Resident Set Size 即"常驻内存集",表示进程或容器当前实际占用的物理内存,包括堆内存、线程栈和部分堆外内存等,通常不包括已转移到Swap中的内存 应用、容器和进程的实际内存使用情况 内存泄漏、频繁GC、容器或进程被OOM杀死
Swap使用率 > 80% Swap是磁盘上的备用内存。物理内存不足时,系统会将暂时不用的数据放入Swap 物理内存不足或内存压力较大的机器 频繁内存换页、系统变慢、内存耗尽和OOM
系统负载 > 3 正在使用CPU、等待CPU或等待磁盘I/O的任务平均数量超过4 判断系统整体是否繁忙 CPU任务排队、磁盘阻塞、系统卡顿
磁盘繁忙率 > 10% 磁盘正在处理读写请求的时间占比超过10%,不是磁盘空间使用率 数据库、日志、文件读写、备份任务 磁盘I/O瓶颈、读写变慢、接口响应延迟
TCP连接数 > 3000,持续3分钟 TCP连接是客户端与服务器之间的网络通信通道,包括浏览器访问服务器、服务之间调用、应用连接数据库等。连接数不等于用户数 服务的并发连接情况 连接堆积、连接未释放、文件描述符耗尽、新连接失败
TCP重传数升高 TCP数据没有成功送达或没有及时收到确认时,系统重新发送数据的次数 浏览器与服务器、服务器与服务器之间的网络通信质量 网络丢包、网络拥塞、请求变慢和超时
网络流入速率 > 50 MB/s 机器每秒接收到的数据超过50 MB,相当于约400 Mbps 文件上传、数据同步、接口请求、消息消费 入站带宽占满、异常流量、网络拥塞
网络流出速率 > 50 MB/s 机器每秒发送出去的数据超过50 MB,相当于约400 Mbps 文件下载、接口响应、日志发送、数据同步 出口带宽占满、异常下载或数据传输
时间偏移 > 1000 ms 机器时间与标准时间源相差超过1秒 服务器时间同步 日志时间错乱、认证失败、定时任务异常、分布式系统数据错序
相关推荐
苍何7 小时前
开源微信流 Windows,微信聊天记录,可以直接给 Codex 和 Obsidan 了
后端
代码什么用8 小时前
Spring基础使用
java·后端·spring
明月_清风9 小时前
Deno 终局来了:从挑战 Node 到被 Cloudflare 收编
前端·后端·node.js
蜗牛互联网9 小时前
Java 17 HttpClient调用文件转写API的超时与失败回退
java·人工智能·后端
用户693717500138412 小时前
2026,程序员的时代拐点到了
android·前端·后端
惜鸟12 小时前
从源码看 pi 的上下文管理:原始数据永久保留,模型视角按需裁剪
后端
量化分析码农12 小时前
【Python量化策略评估体系 #05】极端行情扛得住吗?2008/2015/2020 三场景压力测试
后端
十年Java程序媛12 小时前
Java 接口和抽象类对比|Java8 新特性,抛弃老旧八股,正确选型
java·spring boot·后端
IT_陈寒12 小时前
SpringBoot自动配置差点让我加班到凌晨
前端·人工智能·后端
用户83562907805112 小时前
使用 Python 对 Excel 工作表进行排序
后端·python