如何排错运行在Kubernetes集群中的服务?

我们的前端服务以job运行。k8s的job用于执行一次性的任务,运行完毕即退出。以job方式运行的前端服务启动程序只做一件事情,将镜像中指定目录下的静态文件上传到对象存储。上传前会做一些变量替换,替换的值和对象存储的连接信息存储在Nacos中。

Nacos的连接信息通过job的环境变量注入,类似下面这样,

复制代码
apiVersion: batch/v1
kind: Job
metadata:
  name: frontend-app-web
spec:
  template:
    metadata:
      labels:
        app: frontend-app-web
    spec:
      containers:
      - name: frontend-app-web
        image: harbor.example.com/frontend-app-web:3
        imagePullPolicy: Always             
        env:          
          - name: NACOS_HOST
            value: nacos-cs.nacos.svc.cluster.local:8848
          - name: NACOS_AUTH_USERNAME
            value: username
          - name: NACOS_AUTH_PASSWORD
            value: veryLongPassword
      restartPolicy: Never

在部署过程中,发现有一个前端服务始终卡在连接Nacos的阶段,日志如下,

起初我确定Nacos的连接信息是没有错的,但日志显示连接Nacos超时。为了排查这个问题,将原本以job方式运行的服务更改为deployment方式,如下,

复制代码
apiVersion: apps/v1
kind: Deployment
metadata:
  name: frontend-app-web
  labels:
    app: frontend-app-web
spec:
  replicas: 1
  selector:
    matchLabels:
      app: frontend-app-web
  template:
    metadata:
      labels:
        app: frontend-app-web
    spec:
      containers:
      - name: frontend-app-web
        image: harbor.example.com/frontend-app-web:3
        imagePullPolicy: Always        

        command: ["/bin/bash"]
        args: ["-c", "while true;do sleep 3600;done"]
        tty: true
        stdin: true
 
        env:
        - name: NACOS_HOST
          value: nacos-cs.nacos.svc.cluster.local:8848
        - name: NACOS_AUTH_USERNAME
          value: username
        - name: NACOS_AUTH_PASSWORD
          value: veryLongPassword        
      restartPolicy: Always

更改为deployment运行,最重要是加入下面四行内容,

复制代码
        command: ["/bin/bash"]
        args: ["-c", "while true;do sleep 3600;done"]
        tty: true
        stdin: true

这样Pod运行后,就可以进入容器内部调试。

Pod启动后,运行镜像原本的启动命令(是一段JavaScript代码,完成文章开头提到的上传前端文件到对象存储的功能),还是一样的报错。和正常服务比较,发现Nacos的连接地址少写了"http://",在容器里面修改环境变量,

复制代码
export NACOS_HOST=http://nacos-cs.nacos.svc.cluster.local:8848

重新运行上传程序,运行成功。

K8s调试Pod核心是集群视角多维度排查,依赖kubectl工具链。因分布式隔离、临时生命周期(重启丢状态),常用logs/exec/临时容器等方法,避免直接操作宿主机。

相关推荐
云川之下17 小时前
【k8s】NAD(NetworkAttachmentDefinition)与SR‑IOV‑Operator 关系
云原生·容器·kubernetes
ZzzZZzzzZZZzzzz…20 小时前
K8S实战:NFS+StorageClass+PV/PVC+Deployment
运维·云原生·容器·kubernetes·storageclass·linux运维·持久卷
三言老师20 小时前
CentOS7.9 + Kubernetes 1.18.20 -清理所有 docker / containerd 残留
docker·容器·kubernetes
circuitsosk21 小时前
从Docker到Kubernetes:AI应用服务化与弹性伸缩的落地实践
人工智能·docker·kubernetes·ai应用部署
AAA@峥21 小时前
K8s 配置管理实战:ConfigMap 与 Secret 完整使用指南
kubernetes·云计算
showyoui1 天前
K8s 集群迁移踩坑:Istio 升级后 nginx 403
网络·docker·kubernetes·istio·service_mesh
海兰1 天前
云原生持续交付平台 Zadig 在 Ubuntu 24.04 上的部署及使用指南
linux·ubuntu·云原生
云川之下1 天前
【k8s】sriov‑device‑plugin、sriov‑network‑config‑daemon详解
云原生·容器·kubernetes
张忠琳2 天前
【NPU】Ascend Device Plugin —Part 6 K8s客户端 + 重复检测模块 超深度源码分析之二
云原生·容器·kubernetes·npu·docker device
雨声不在2 天前
私有 Docker Registry 排障实录:两个隐蔽的坑
docker·容器