怎么排查pod重启

1. 第一步:用 kubectl describe pod 抓重启关键信息

这是最直接的入口,能快速获取重启次数、原因和触发事件。

  • 执行命令:kubectl describe pod <Pod名称> -n <命名空间>
  • 重点看 3 处:
    • Restart Count:确认具体重启次数,判断是偶发还是高频重启。
    • Last State :显示上一次退出状态,若为 Error(代码错误)或 OOMKilled(内存溢出,高频原因),会直接标注。
    • Events 字段:底部会记录重启触发事件,比如 "健康检查失败(Readiness/ Liveness Probe Failed)""资源不足被驱逐" 等,原因一目了然。

2. 第二步:用 kubectl logs 查应用崩溃日志

若第一步发现是 Error 退出,必须通过日志定位代码或配置问题。

  • 查看崩溃前日志(关键):kubectl logs <Pod名称> -n <命名空间> --previous,这能获取 Pod 重启前的错误堆栈(如代码报错、配置文件缺失),是定位应用层问题的核心。
  • 实时查看日志:若 Pod 仍在反复重启,用 kubectl logs <Pod名称> -n <命名空间> -f 实时捕捉启动到崩溃的日志,观察是否卡在特定步骤(如连接依赖超时)。

3. 第三步:检查资源限制与健康检查配置

排除应用本身问题后,多数重启源于资源不足或健康检查误判。

  • 排查资源溢出:若 Last State 显示 OOMKilled,执行 kubectl top pod <Pod名称> -n <命名空间>,对比 Pod 的 resources.limits 配置,确认是否内存 / CPU 超限制(比如限制 1Gi 内存,实际用了 1.2Gi)。
  • 检查健康检查:若 Events 显示 "Probe Failed",查看 Pod 的 livenessProbe(存活检查)配置,比如端口写错、检查路径不存在,或应用启动慢导致 "启动中被误判为死锁而重启"(可拉长 initialDelaySeconds 解决)。
相关推荐
神奇霸王龙5 小时前
Claude Code屠榜:MiMo与Grok紧追Codex
服务器·网络·人工智能·gpt·ai·ai编程
Web极客码5 小时前
WordPress SEO优化:提升网站排名的13个关键步骤
服务器·seo·wordpress
生活爱好者!5 小时前
我把NAS当作下载机,docker一键部署qb
运维·docker·容器
groundhappy6 小时前
idalib安装和codex ida-mcp配置
linux·开发语言·python
尽兴-6 小时前
企业业务系统架构选型与渐进式演进
运维·系统架构·devops
通信小小昕7 小时前
Ubuntu 26.04 中文输入法安装
linux·运维·ubuntu
壮哥_icon7 小时前
【Android 系统开发】使用 BAT 脚本高效自动化管理 /system/priv-app/ 系统应用(安装与卸载)
android·运维·自动化
RD_daoyi7 小时前
外链权重暴跌至13%,品牌提及反超传统链接——2026年不做Digital PR,你的独立站等于隐形
运维·网络·学习·机器学习·搜索引擎
电商API_180079052478 小时前
企业ERP进销存场景|京东商品详情接口自动同步方案|凭证鉴权批量调用技术实操
大数据·运维·人工智能·爬虫·数据挖掘·网络爬虫
张小姐的猫8 小时前
【Linux】网络编程 —— HTTP协议(上)
linux·运维·服务器·网络·http·单例模式·策略模式