Kubernetes 1.36 深度解读:从 kubelet 安全到 GPU 原生调度的 70 项改进

1. 版本概览:18 项 Stable、25 项 Beta、25 项 Alpha 的整体分布

Kubernetes 1.36 共带来 70 项功能改进,其中 18 项进入 Stable(稳定版)、25 项进入 Beta(测试版)、25 项处于 Alpha(内测版)。这一分布延续了社区「渐进式成熟」的发布策略:核心稳定性优先,同时为前沿方向保留探索空间。

从演进节奏看,Stable 项集中在调度、存储与节点生命周期等基础能力;Beta 项聚焦于工作负载 API 与网络插件生态;Alpha 项则覆盖 GPU 原生调度、设备切分等面向未来的特性。整体上,1.36 在「安全加固」与「硬件加速」两条主线上投入明显。

2. 细粒度 kubelet API 鉴权 GA:最小权限原则如何落地

kubelet 是每个节点上的核心代理,其 API 长期采用较粗粒度的授权模型。1.36 将细粒度 kubelet API 鉴权提升为 GA,允许管理员按子资源、按操作(get/list/watch/create/update)精确控制访问范围。

落地要点包括:

  • 基于 node 与 pods 子资源拆分权限,避免「一次授权、全量放开」。
  • 支持通过 RBAC 规则限定到具体节点或节点池。
  • 审计日志可清晰记录每次 kubelet API 调用的来源与动作,便于合规追溯。

对集群管理员而言,这意味着可以把「读取节点状态」与「驱逐 Pod」等操作彻底分离,真正落实最小权限原则。

3. DRA 进阶:从 GPU 扩展到内存和 CPU 原生资源,可切分设备与资源健康状态

动态资源分配(DRA)在 1.36 迎来重要升级。此前 DRA 主要面向 GPU 等整卡设备,本次扩展支持内存、CPU 等原生资源的动态分配,并引入「可切分设备」概念------即一个物理设备可按需划分为多个逻辑资源单元,分别绑定到不同 Pod。

同时,DRA 新增资源健康状态上报机制。节点上的设备驱动可定期上报设备健康度,调度器据此避开故障或降级设备,提升作业稳定性。这一能力对 AI 训练、高性能计算等长时任务尤为关键。

4. Workload API 与 PodGroup API 分离:工作负载感知调度的架构演进

1.36 将 Workload API 与 PodGroup API 正式分离,为工作负载感知调度奠定更清晰的架构基础。此前 PodGroup 概念与工作负载模型耦合较紧,难以支撑多样化的批处理与 AI 作业。

分离后:

  • Workload API 负责描述作业的拓扑、依赖与资源画像。
  • PodGroup API 独立管理 Pod 分组的生命周期与调度约束。
  • 调度器可基于分组语义实现 gang scheduling(成组调度)、优先级抢占与资源配额协同。

这一演进让 Volcano、Kueue 等批处理项目能更自然地对接原生 API,减少自定义扩展的维护成本。

5. Cilium 替代 kube-proxy:网络栈的默认变化

kube-proxy 长期承担 Service 流量转发职责,但其基于 iptables 的实现存在规则膨胀与性能瓶颈。1.36 在网络栈层面推动 Cilium 作为更优替代,借助 eBPF 实现高性能、可观测的 Service 负载均衡。

主要收益:

  • 规则数量大幅下降,长尾延迟更稳定。
  • 原生支持集群内 L7 策略与可观测性。
  • 与 Cilium CNI 深度集成,减少组件重复。

需要说明的是,Cilium 替代 kube-proxy 目前仍以「可选默认」方式推进,传统 iptables 模式仍受支持,便于平滑迁移。

6. 升级建议与兼容性注意事项

升级到 1.36 前,建议关注以下几点:

  • 确认 kubelet API 鉴权策略:细粒度授权为 GA 后,原有宽泛 RBAC 规则可能失效,需提前梳理并迁移。
  • 评估 DRA 插件兼容性:若已使用第三方 DRA 驱动,需验证其是否支持可切分设备与健康状态上报。
  • 网络栈迁移节奏:Cilium 替代 kube-proxy 建议先在测试环境验证 eBPF 行为,再逐步灰度到生产。
  • 关注 PodGroup API 变更:若依赖旧版聚合语义,需按新 API 调整控制器与调度配置。

整体而言,1.36 在安全、调度与网络三条主线上均有实质进展,值得有计划地规划升级窗口。

相关推荐
YH行业报告分析3 小时前
2026衬氟调节阀市场深度解析:耐腐蚀流体控制设备如何赋能化工行业安全升级?
安全
赛博守夜人3 小时前
跨境业务与出海合规之九:海外买量投放与营销虚假流量(Ad Fraud):跨国机房群控与归因欺诈识别算法
算法·安全
loong_XL4 小时前
决策模型做内容安全检测:从踩坑到上线
数据库·安全·jev·决策模型
晓德4 小时前
0、LLM大模型安全学习系列(启)
学习·安全
程序哥聊面试4 小时前
什么是 Sandbox?给 AI Agent 划一道安全边界
人工智能·安全
wzq11_6665 小时前
kubernetes集群——灰度发布
云原生·容器·kubernetes
山东科恩光电6 小时前
安全地毯在工业机器人与流水线防护中的应用及安装选型指南
安全
悟天特斯6 小时前
安防一体化的“AI进化“:从被动监控到主动预警的智慧安全运营
人工智能·安全
lisw058 小时前
基于人工智能的安全分析技术: 用于实时识别威胁
人工智能·安全