K8S节点磁盘空间不足导致502错误的排除

业务系统出现502错误,k8s dashboard也上不去了,执行命令

复制代码
kubectl get all -n kubernetes-dashboard

发现很多evicted pod

业务pod基本正常,但进不去,估计是ingress的问题。于是查看ingress-controller节点的磁盘空间,发现只剩下14%了,而k8s缺省要求有15%以上,估计是节点空间不足,把ingress-controller部署到其它节点了,于是,清理一些日志:

复制代码
# 1. 删除所有已停止容器的日志文件
find /var/lib/docker/containers -name "*.log" -type f -delete

# 2. 清理7天前的日志
find /var/lib/docker/containers -name "*.log" -type f -mtime +7 -delete

# 3. 清理大于100M的日志文件
find /var/lib/docker/containers -name "*.log" -type f -size +100M -delete

# 4. 安全清理(保留最近文件)
find /var/lib/docker/containers -name "*.log" \
  -type f \
  -mtime +30 \
  -exec rm -f {} \;

#5 删除Evicted节点
kubectl delete pods --all-namespaces --field-selector=status.phase=Failed

再看磁盘空间有17%了,接着就生启ingress pod吧

复制代码
kubectl rollout restart deployment -n ingress-nginx

再看业务系统正常了。

接下来就是扩充磁盘,减少日志等工作了。

复制代码
# 查看节点是否处于磁盘压力状态
kubectl describe node <node-name> | grep -i "diskpressure"

# 查看事件
kubectl get events --field-selector involvedObject.kind=Node,involvedObject.name=<node-name>
相关推荐
艾伦_耶格宇1 小时前
【DOCKER进阶】-3 cgroups
docker·容器·eureka
ltl2 小时前
nodeSelector 与节点放置:Filter、亲和性与拓扑打散
kubernetes
ltl2 小时前
Envoy Gateway 排障:未 Accepted、空 IR、xDS NACK 与旧快照
kubernetes
ltl2 小时前
Envoy Gateway 南北向全景:附着、IR、xDS 与东西向交界
kubernetes
ltl2 小时前
Tetragon 运行时安全全景:缺口、五轴坐标系与阅读路线
kubernetes
阿里云云原生6 小时前
RCA 决定 AgenticOps 的行动方向:STAROps 如何把根因定位做成系统能力
云原生
我有2只猫7 小时前
vLLM Docker 本地部署小模型
docker·容器·vllm
腾讯数据架构师8 小时前
壁仞 GPU 怎么接入 Kubernetes 和 AI 平台?CubeStudio 壁仞算力适配实操
人工智能·容器·kubernetes·cube-studio·ai平台
有脚就行8 小时前
第28篇-Kubernetes-GPU调度机制-Device-Plugin与GPU-Operator
人工智能·容器
键盘鼓手苏苏9 小时前
AI 内容生成管线设计:从多模态编排到质量守门的生产级架构
云原生·kubernetes·k8