K8S集群中驱逐节点

K8S集群中驱逐node节点

下面以驱逐节点上的GPU节点为例:

1.驱逐节点上的资源

使用以下命令从节点上驱逐 GPU 资源:

复制代码
kubectl drain <node-name> --delete-local-data --force --ignore-daemonsets

说明:

  • <node-name> 是要驱逐 GPU 的节点名称。
  • --delete-local-data 会删除节点上的本地数据。
  • --force 强制执行节点驱逐操作,即使节点上有未被调度的 Pod。
  • --ignore-daemonsets 忽略 DaemonSet 的 Pod,允许驱逐进行。

示例:

复制代码
kubectl drain gpu-node --delete-local-data --force --ignore-daemonsets

2.等待节点驱逐完成

Kubernetes 将会将节点上的 Pod 调度到其他节点上,等待所有 Pod 成功调度到其他节点后,节点才会完全驱逐完成。

复制代码
kubectl delete pod gpu-node

1.验证驱逐

使用以下命令确认节点已经成功驱逐,并且节点上的 GPU 资源不再被使用:

复制代码
kubectl get nodes

确保节点状态为 Ready,并且没有任何 Pod 在其上运行。

相关推荐
张忠琳13 小时前
【NPU】Ascend Device Plugin —Part 6 K8s客户端 + 重复检测模块 超深度源码分析之二
云原生·容器·kubernetes·npu·docker device
雨声不在13 小时前
私有 Docker Registry 排障实录:两个隐蔽的坑
docker·容器
云川之下14 小时前
【k8s】SR‑IOV‑Network‑Operator 详解
云原生·容器·kubernetes
云烟成雨TD14 小时前
Micrometer 系列【29】源码分析:MeterRegistry 实例化流程
java·云原生·micrometer
读书读傻了哟14 小时前
解决docker拉取镜像报错failed to resolve reference “docker.io/xxx“...i/o timeout问题
运维·docker·容器
风曦Kisaki15 小时前
对象存储 MinIO 的两种生产环境适用部署方式
kubernetes
Ai拆代码的曹操16 小时前
DaemonSet OnDelete 策略详解:为何 rollout restart 无效及正确迁移方案
docker·容器·kubernetes
名字还没想好☜16 小时前
Kubernetes NetworkPolicy 实战:默认全通的坑与用标签做零信任隔离
运维·云原生·容器·kubernetes·networkpolicy
Crazy________16 小时前
Redis02:库切换、监控与安全配置
linux·redis·云原生·mybatis
ai_coder_ai18 小时前
平台工程(Platform Engineering)在企业数字化中的应用
云原生