K8S节点磁盘空间不足导致502错误的排除

业务系统出现502错误,k8s dashboard也上不去了,执行命令

复制代码
kubectl get all -n kubernetes-dashboard

发现很多evicted pod

业务pod基本正常,但进不去,估计是ingress的问题。于是查看ingress-controller节点的磁盘空间,发现只剩下14%了,而k8s缺省要求有15%以上,估计是节点空间不足,把ingress-controller部署到其它节点了,于是,清理一些日志:

复制代码
# 1. 删除所有已停止容器的日志文件
find /var/lib/docker/containers -name "*.log" -type f -delete

# 2. 清理7天前的日志
find /var/lib/docker/containers -name "*.log" -type f -mtime +7 -delete

# 3. 清理大于100M的日志文件
find /var/lib/docker/containers -name "*.log" -type f -size +100M -delete

# 4. 安全清理(保留最近文件)
find /var/lib/docker/containers -name "*.log" \
  -type f \
  -mtime +30 \
  -exec rm -f {} \;

#5 删除Evicted节点
kubectl delete pods --all-namespaces --field-selector=status.phase=Failed

再看磁盘空间有17%了,接着就生启ingress pod吧

复制代码
kubectl rollout restart deployment -n ingress-nginx

再看业务系统正常了。

接下来就是扩充磁盘,减少日志等工作了。

复制代码
# 查看节点是否处于磁盘压力状态
kubectl describe node <node-name> | grep -i "diskpressure"

# 查看事件
kubectl get events --field-selector involvedObject.kind=Node,involvedObject.name=<node-name>
相关推荐
colourmind2 小时前
K3S+Hami+Higress+Vip(nginx+keepalived)搭建云原生高可用的大模型部署平台
运维·nginx·云原生
闲云野鹤在人间2 小时前
Docker入门|第3章 镜像详解
linux·网络·docker·容器·centos·云计算·php
闲云野鹤在人间3 小时前
Docker入门|第2章 容器架构详解
linux·运维·docker·容器·架构·云计算
wzq11_6663 小时前
Docker数据卷管理
运维·docker·容器
小牛马爱写博客3 小时前
K8s 中部署WordPress 博客
云原生·容器·kubernetes
汪碧康4 小时前
xkube-v4.3版本的安全性进行了增强
docker·云原生·容器·kubernetes·xkube
EterNity_TiMe_4 小时前
Pascal Editor 本地部署实战:Bun 启动 WebGPU 3D 编辑器,再解决公网访问报错
人工智能·docker·ai·容器·cpolar
AugustSkys8 小时前
从 Docker 到 Containerd:Kubernetes 时代容器运行时完全指南
docker·容器·kubernetes·containerd
莫陌尛.13 小时前
Docker MySQL 删表卡死、执行超时(MDL锁阻塞)问题复盘与根治方案
mysql·docker·容器
天天喝旺仔13 小时前
Go 并发编程:Goroutine 与 Channel 实战
云原生·性能优化·架构·go