1. 版本概览:18 项 Stable、25 项 Beta、25 项 Alpha 的整体分布
Kubernetes 1.36 共带来 70 项功能改进,其中 18 项进入 Stable(稳定版)、25 项进入 Beta(测试版)、25 项处于 Alpha(内测版)。这一分布延续了社区「渐进式成熟」的发布策略:核心稳定性优先,同时为前沿方向保留探索空间。
从演进节奏看,Stable 项集中在调度、存储与节点生命周期等基础能力;Beta 项聚焦于工作负载 API 与网络插件生态;Alpha 项则覆盖 GPU 原生调度、设备切分等面向未来的特性。整体上,1.36 在「安全加固」与「硬件加速」两条主线上投入明显。
2. 细粒度 kubelet API 鉴权 GA:最小权限原则如何落地
kubelet 是每个节点上的核心代理,其 API 长期采用较粗粒度的授权模型。1.36 将细粒度 kubelet API 鉴权提升为 GA,允许管理员按子资源、按操作(get/list/watch/create/update)精确控制访问范围。
落地要点包括:
- 基于
node与pods子资源拆分权限,避免「一次授权、全量放开」。 - 支持通过 RBAC 规则限定到具体节点或节点池。
- 审计日志可清晰记录每次 kubelet API 调用的来源与动作,便于合规追溯。
对集群管理员而言,这意味着可以把「读取节点状态」与「驱逐 Pod」等操作彻底分离,真正落实最小权限原则。
3. DRA 进阶:从 GPU 扩展到内存和 CPU 原生资源,可切分设备与资源健康状态
动态资源分配(DRA)在 1.36 迎来重要升级。此前 DRA 主要面向 GPU 等整卡设备,本次扩展支持内存、CPU 等原生资源的动态分配,并引入「可切分设备」概念------即一个物理设备可按需划分为多个逻辑资源单元,分别绑定到不同 Pod。
同时,DRA 新增资源健康状态上报机制。节点上的设备驱动可定期上报设备健康度,调度器据此避开故障或降级设备,提升作业稳定性。这一能力对 AI 训练、高性能计算等长时任务尤为关键。
4. Workload API 与 PodGroup API 分离:工作负载感知调度的架构演进
1.36 将 Workload API 与 PodGroup API 正式分离,为工作负载感知调度奠定更清晰的架构基础。此前 PodGroup 概念与工作负载模型耦合较紧,难以支撑多样化的批处理与 AI 作业。
分离后:
- Workload API 负责描述作业的拓扑、依赖与资源画像。
- PodGroup API 独立管理 Pod 分组的生命周期与调度约束。
- 调度器可基于分组语义实现 gang scheduling(成组调度)、优先级抢占与资源配额协同。
这一演进让 Volcano、Kueue 等批处理项目能更自然地对接原生 API,减少自定义扩展的维护成本。
5. Cilium 替代 kube-proxy:网络栈的默认变化
kube-proxy 长期承担 Service 流量转发职责,但其基于 iptables 的实现存在规则膨胀与性能瓶颈。1.36 在网络栈层面推动 Cilium 作为更优替代,借助 eBPF 实现高性能、可观测的 Service 负载均衡。
主要收益:
- 规则数量大幅下降,长尾延迟更稳定。
- 原生支持集群内 L7 策略与可观测性。
- 与 Cilium CNI 深度集成,减少组件重复。
需要说明的是,Cilium 替代 kube-proxy 目前仍以「可选默认」方式推进,传统 iptables 模式仍受支持,便于平滑迁移。
6. 升级建议与兼容性注意事项
升级到 1.36 前,建议关注以下几点:
- 确认 kubelet API 鉴权策略:细粒度授权为 GA 后,原有宽泛 RBAC 规则可能失效,需提前梳理并迁移。
- 评估 DRA 插件兼容性:若已使用第三方 DRA 驱动,需验证其是否支持可切分设备与健康状态上报。
- 网络栈迁移节奏:Cilium 替代 kube-proxy 建议先在测试环境验证 eBPF 行为,再逐步灰度到生产。
- 关注 PodGroup API 变更:若依赖旧版聚合语义,需按新 API 调整控制器与调度配置。
整体而言,1.36 在安全、调度与网络三条主线上均有实质进展,值得有计划地规划升级窗口。