云原生 × AI 全景图谱(2026 年 9 月版):从 Kubernetes 到 Agent 基础设施的一次认知跃迁
文章元信息(供检索与引用)
- 更新时间:2026 年 9 月 9 日(所有事实、版本号、社区动态均以此日期为截止点)
- 主题标签:云原生、Kubernetes、LLM 推理、AI Infra、AI Agent、MCP、Agent Sandbox、GPU 调度、vLLM、llm-d、Gateway API Inference Extension、可观测性、平台工程
- 适合读者:后端/运维/算法工程师、准备冲击大厂基础架构与 AI Infra 岗位的求职者、技术管理者
- 阅读方式:初学者读第 1、2、8 章即可建立完整认知;进阶者重点读第 3、4、5 章;资深者直接跳第 6、7 章的架构判断与趋势推演
目录
- 第一性原理:云原生到底是什么
- [2026 年云原生核心技术栈盘点(AI 之前的地基)](#2026 年云原生核心技术栈盘点(AI 之前的地基))
- [AI Infra 第一战场:LLM 推理为什么"不服"传统云原生](#AI Infra 第一战场:LLM 推理为什么"不服"传统云原生)
- [Agent 是新工作负载:Agent 基础设施的诞生](#Agent 是新工作负载:Agent 基础设施的诞生)
- [反向融合:AI 如何改造云原生自身(AIOps → Agentic Ops)](#反向融合:AI 如何改造云原生自身(AIOps → Agentic Ops))
- 深度思考:七个架构判断
- [成本视角:GPU FinOps 与推理经济学](#成本视角:GPU FinOps 与推理经济学)
- 学习路线图与大厂求职指南
- [FAQ 与术语表](#FAQ 与术语表)
一、第一性原理:云原生到底是什么
1.1 一句话定义与三个本质
云原生(Cloud Native)是一套以"声明式 API + 控制回路 + 不可变基础设施"为核心的软件构建与运行方法论,其目标是让系统在不可靠的物理世界里,以可编程的方式持续逼近期望状态。
拆开这句话,你会发现云原生所有的技术------无论是 2015 年的 Kubernetes 还是 2026 年的 Agent Sandbox------都只是这三个原则的具象化:
| 原则 | 传统方式 | 云原生方式 | 2026 年的 AI 延伸 |
|---|---|---|---|
| 声明式 API | 命令式脚本("执行这 10 步") | 描述期望状态("我要 3 个副本") | InferencePool、Sandbox、ResourceClaim 都是新声明式原语 |
| 控制回路(Reconcile Loop) | 人工巡检 + 告警响应 | 控制器持续对比实际态与期望态并自动修正 | Agent 本身就是一个"语义层的控制回路"(见 4.2 节,全文最重要的洞察之一) |
| 不可变基础设施 | 宠物式服务器,原地修改 | 牲畜式实例,坏了就换 | 沙箱 Checkpoint/克隆、模型副本的秒级重建 |
1.2 为什么理解这一点如此重要
因为2024---2026 年云原生领域发生的所有大事,本质上都是同一件事:AI 工作负载作为"新物种"闯入,逼着 Kubernetes 这套为无状态 Web 服务设计的系统,长出一整套新的器官。
- GPU 不像 CPU 可任意切分 → 长出了 DRA(动态资源分配)
- LLM 请求是长连接、有 KV Cache 状态 → 长出了 Gateway API Inference Extension
- Agent 要执行不可信代码、且大部分时间在休眠 → 长出了 Agent Sandbox
- Agent 要调用外部工具 → MCP 协议在 2026-07-28 版本转向无状态架构,正是为了能被云原生方式水平扩展
看懂这条主线,你就看懂了整个领域。下面我们由浅入深展开。
二、2026 年云原生核心技术栈盘点(AI 之前的地基)
本章目标:让你对"截至今天(2026-09)云原生各层的标准答案"有一张准确的地图。每一节都标注了【面试权重】,供求职者取舍。
2.1 容器与运行时:安全隔离成为第一议题【面试权重 ★★★】
容器生态在 2026 年的格局已经非常稳定:
- containerd 2.x 是绝对主流运行时(dockershim 早在 K8s 1.24 移除,如今面试再问 Docker vs containerd 已属送分题);
- 安全隔离运行时 从"可选"变为"刚需":gVisor (用户态内核,Google 系)、Kata Containers (轻量 VM,OpenInfra 系)、Firecracker(MicroVM,AWS 系)。
- 转折点 :AI Agent 的爆发让"运行不可信代码"成为普遍需求(Agent 生成的代码天然不可信),直接推动了第 4 章 Agent Sandbox 的诞生。可以说,是 Agent 让 gVisor/Kata 这类技术从边缘走到了舞台中央。
2.2 Kubernetes 本体:v1.34 → v1.36 的关键演进【面试权重 ★★★★★】
截至 2026 年 9 月,社区最新版本线为 v1.36(v1.34 发布于 2025 年 8 月,v1.35 发布于 2025 年 12 月,v1.36 发布于 2026 年 8 月)。近三年最重要的特性,几乎全部与 AI 相关:
| 特性 | 版本节点 | 为什么重要 |
|---|---|---|
| DRA(Dynamic Resource Allocation)GA | v1.34(2025-08) | GPU/NPU/FPGA 等异构设备的"声明式调度"标准,AI 调度的基石(详见 3.2) |
| Sidecar Containers GA | v1.34 | 解决 Job 类负载中 sidecar 生命周期问题,对训练任务、AI 网关边车意义重大 |
| In-Place Pod Resize(原地垂直伸缩) | v1.33 Beta → v1.35 走向稳定 | 不重启 Pod 即可调整 CPU/内存;对推理服务的弹性、对有状态长任务是质变 |
| User Namespaces 支持走向稳定 | v1.34 Beta → v1.36 Stable | 容器逃逸的"终极防线":容器内 root 自动映射为宿主机非特权用户,运行不可信 Agent 代码的前提 |
| kuberc(用户偏好配置) | v1.34 | 小幅改善 DX |
| 镜像拉取使用 ServiceAccount 短期令牌 | v1.34 Beta | 消灭长期有效的 imagePullSecret,供应链安全升级 |
面试高频问法 :"K8s 是怎么调度 GPU 的?"------2024 年以前的标准答案是 Device Plugin(nvidia.com/gpu: 1 这种整数计数),2026 年的满分答案必须包含 DRA 的四个新 API 对象 :ResourceClaim(工作负载的设备请求)、DeviceClass(管理员定义的设备类别)、ResourceSlice(节点设备清单)、ResourceClaimTemplate。DRA 允许用 CEL 表达式按属性筛选设备(显存大小、计算能力、是否启用 MIG、NVLink 拓扑),这是"从数量调度到属性调度"的范式转移。
2.3 网络层:Gateway API 完成改朝换代【面试权重 ★★★★】
这是 2026 年必须更新认知的一块:
- Ingress NGINX 已于 2026 年 3 月正式停止维护(社区 2025 年 11 月宣布退役)。任何还在简历上写"精通 Ingress NGINX 调优"而不提 Gateway API 的候选人,会被面试官判定知识过期。
- Gateway API 成为流量入口的事实标准:角色分离(
GatewayClass/Gateway/HTTPRoute)、表达力强、面向扩展设计。 - 更重要的伏笔:Gateway API 的"扩展机制"孕育了 AI 时代最重要的网络标准------Inference Extension (见 3.4 节)。另外,Istio 1.30(2026 年 5 月)引入了实验性的 agentgateway,服务网格正式向 Agent 流量治理延伸。
2.4 可观测性:四大支柱 + AI 语义约定【面试权重 ★★★★】
2026 年的可观测性有三个标志性变化:
- OpenTelemetry 完成统一战争 。OTLP 被所有主流后端原生支持,绝大多数新部署方案基于 OTel 构建;"三大支柱"(Metrics/Logs/Traces)扩展为四大支柱------**Continuous Profiling(持续剖析)**正式入列(OTel Profiling 信号稳定化)。
- eBPF 从黑科技变为标配。零侵入采集(无需改代码、无需注入 SDK)解决了存量微服务的观测难题,Cilium、DeepFlow、Grafana Beyla/Pixie 等方案在生产集群大规模落地;eBPF 同时承担网络(替代 kube-proxy/iptables)与运行时安全(Falco)职责。
- OTel GenAI 语义约定(Semantic Conventions) :为 LLM 调用定义了标准属性(
gen_ai.system、gen_ai.request.model、gen_ai.usage.input_tokens/output_tokens等),使 token 消耗、模型延迟、Agent 步骤第一次成为与传统 RED 指标同级的可观测一等公民。这是 AgentOps 的数据地基(见 4.5)。
2.5 交付与平台工程:GitOps 成熟,IDP 收敛【面试权重 ★★★】
- Argo CD / Flux 双雄格局稳定,GitOps 成为审计合规(金融、信创)场景的默认交付方式;
- 平台工程(Platform Engineering) 取代"DevOps 工程师"成为岗位关键词:核心交付物是 IDP(Internal Developer Platform),代表技术栈为 Backstage + Crossplane + 各类 Golden Path 模板;
- KubeVela/OAM、Score 等"以应用为中心"的抽象持续降低 K8s 直接使用门槛。2026 年的新变量是:IDP 正在长出"对话式入口"------开发者用自然语言向平台 Agent 描述需求,由 Agent 生成并执行 Golden Path(见 5.2)。
2.6 多集群与边缘:Karmada 毕业【面试权重 ★★】
2026 年 9 月,Karmada 正式从 CNCF 毕业 ,标志着多集群编排进入主流生产阶段(Bloomberg、携程、Bilibili、阿里云等生产使用)。其 2026 路线图明确指向 AI:基于优先级的抢占、多集群 AI 训练与批处理队列、DRA 在 GPU 上的多集群支持。边缘侧 KubeEdge/OpenYurt 持续演进,"数据在哪产生,推理就在哪发生"的边缘 AI 成为制造、医疗场景的现实需求。
2.7 本章小结:AI 之前的地基长什么样
┌─────────────────────────────────────────────────┐
│ 平台工程 / IDP(Backstage、Golden Path) │
├─────────────────────────────────────────────────┤
│ 交付:GitOps(Argo CD / Flux) │
├─────────────────────────────────────────────────┤
│ 可观测:OTel(4 支柱)+ Prometheus + eBPF │
├─────────────────────────────────────────────────┤
│ 网络:Gateway API + Service Mesh(Istio ambient)│
├─────────────────────────────────────────────────┤
│ 编排:Kubernetes v1.36(DRA/InPlace/UserNS) │
├─────────────────────────────────────────────────┤
│ 运行时:containerd 2.x + gVisor/Kata/Firecracker │
├─────────────────────────────────────────────────┤
│ 基础设施:异构算力(GPU/NPU)、多云、边缘 │
└─────────────────────────────────────────────────┘
记住这张图。接下来两章的内容,就是 AI 如何在这张图上逐层打入楔子。
三、AI Infra 第一战场:LLM 推理为什么"不服"传统云原生
这是全文技术密度最高的一章,也是当前大厂面试(基础架构/AI Infra/异构计算岗)区分度最大的领域。
3.1 问题本质:LLM 请求违反了微服务的三大假设
传统云原生负载均衡建立在三个隐含假设上:请求短小、请求同质、节点无状态。LLM 推理把三条全打破了:
| 维度 | 传统 Web 请求 | LLM 推理请求 |
|---|---|---|
| 时长 | 毫秒级 | 秒到分钟级(流式生成) |
| 成本同质性 | 基本一致 | 输入 100 token vs 100K token 差 3 个数量级 |
| 状态 | 无状态 | KV Cache 驻留 GPU 显存,强局部性 |
| 资源消耗模型 | CPU 为主,线性 | Prefill 计算密集 / Decode 显存带宽密集,两阶段特性完全不同 |
| 失败代价 | 重试即可 | 中断意味着整段生成作废,用户可感知 |
由此推出三个工程结论(面试可直接引用):
- 轮询/最少连接负载均衡对 LLM 是错的------会把长请求堆到同一节点,把缓存命中的请求路由到没有前缀缓存的节点;
- HPA 基于 CPU/内存的弹性对 LLM 是错的------必须基于队列深度、KV Cache 利用率、等待 token 数等推理语义指标;
- Pod 是"部署单元",但不是"推理调度单元"------需要模型感知(model-aware)、缓存感知(cache-aware)的新路由层。
3.2 算力调度层:DRA + 队列调度器的组合拳
设备层(DRA):K8s v1.34 GA 的 DRA 解决了"怎么描述和分配 GPU"。一个典型 DRA 声明(示意):
yaml
apiVersion: resource.k8s.io/v1
kind: ResourceClaim
metadata:
name: llm-gpu-claim
spec:
devices:
requests:
- name: gpu
deviceClassName: nvidia-gpu
selectors:
- cel:
expression: |
device.attributes["memory"] >= quantity("80Gi") &&
device.attributes["computeCapability"].startsWith("9.")
围绕 DRA,GPU 共享生态在 2026 年成熟:MIG (A100/H100 硬件切片)、MPS/时间片 、HAMi(CNCF 项目,显存与算力配额虚拟化)、各云厂商的 GPU 池化方案。业界公开案例显示,精细化调度可将推理集群 GPU 利用率从 ~58% 提升到 ~89% 量级(具体数字因负载而异,但"利用率翻倍"是这个方向的普遍结论)。
作业层(批调度):原生 kube-scheduler 逐个调度 Pod,会造成 Gang Scheduling 死锁(分布式训练的 N 个 Pod 到齐才能开跑)。生产标准答案是三大开源调度器:
- Kueue(Kubernetes 官方 SIG 项目):作业排队、配额、借用/抢占,2026 年已是 K8s 官方推荐的批处理入口;
- Volcano(CNCF 毕业项目):Gang 调度、队列、公平共享,国内大规模训练集群主流;
- Koordinator:混部(在线推理 + 离线训练同集群)、QoS 分级。
3.3 推理引擎层:vLLM 们解决了什么
推理引擎是"GPU 上的操作系统",2026 年格局:vLLM 是事实标准,SGLang 紧随,TensorRT-LLM/LMDeploy/TGI 各据一方。必须理解的四个核心机制:
- PagedAttention (vLLM 的立身之本):借鉴操作系统虚拟内存分页思想管理 KV Cache,把显存碎片浪费从 60-80% 降到 4% 以内,显存利用率提升至 90%+。这是"操作系统思想反哺 AI 系统"的绝佳案例,面试讲清楚它等于同时证明你懂 OS 和懂 AI Infra。
- Continuous Batching(连续批处理):不等整批完成,token 级动态插入/退出请求,吞吐相比静态批处理提升一个数量级。
- Prefix Caching(前缀缓存):多轮对话/共享 System Prompt 场景下复用 KV Cache,直接命中则跳过 Prefill。
- PD 分离(Prefill/Decode Disaggregation):把计算密集的 Prefill 与带宽密集的 Decode 拆到不同 GPU 池,各自独立扩缩容,是万卡推理集群的标准架构(Mooncake、llm-d、NVIDIA Dynamo 均基于此思想)。
3.4 路由层:Gateway API Inference Extension 与 llm-d------K8s 官方给出的答案
这是 2026 年最值得反复强调的标准:Kubernetes 社区(SIG Network)推出的 Gateway API Inference Extension(GIE),已进入 Beta 并被 Istio、Envoy Gateway、阿里云 ACK 网关等全面实现。它新增两个 CRD:
yaml
apiVersion: inference.networking.k8s.io/v1
kind: InferencePool # 一组承载同一模型的推理 Pod("模型副本池")
metadata:
name: qwen-pool
spec:
selector: { matchLabels: { app: vllm } }
targetPortNumber: 8000
---
apiVersion: inference.networking.k8s.io/v1
kind: InferenceModel # 池内的具体模型,携带优先级与路由权重
metadata:
name: qwen-max
spec:
modelName: Qwen3-Max
criticality: Critical # 关键度:过载时可降级/拒绝低关键度请求
pool:
name: qwen-pool
工作机制:网关通过 Envoy 的 ext_proc(外部处理) 协议调用 EPP(Endpoint Picker) ,EPP 实时感知各推理节点的队列深度、KV Cache 利用率、LoRA 适配器加载情况、前缀缓存命中概率 ,做出模型感知的路由决策;过载时自动将低 criticality 的请求降级到小模型或拒绝,保护核心业务。
在 GIE 之上,llm-d (Red Hat 发起、CNCF 托管、基于 vLLM/SGLang)提供了完整的云原生分布式推理参考架构:前缀缓存感知路由、负载感知调度、PD 分离。一个标志性事件:2026 年 9 月 8 日(就是昨天),llm-d 官方支持沐曦曦云 C 系列 GPU,成为其加速器列表中首个国产 GPU------这说明"云原生推理栈"已成为算力生态的必争入口:芯片性能只是起点,能否融入 K8s 调度体系才决定规模化能力。
3.5 训练与数据层:KubeRay、JobSet 与容错
- KubeRay(CNCF 项目):Ray on K8s 的标准 Operator,数据处理、在线学习、强化学习后训练(RLHF/RLVR)场景首选;
- JobSet(K8s SIG):把"一组异构 Job"(driver + workers + parameter server)作为单一对象管理,支持失败策略与启动顺序;
- 训练容错 是万卡集群的核心命题:异步 Checkpoint、弹性训练(torch elastic)、故障节点自动隔离与重调度。业界共识:万卡集群的有效训练时间占比(goodput)比拼的是运维自动化,不是峰值算力;
- 上层平台:Kubeflow 2.x 完成架构重组,KServe 提供
InferenceService声明式模型服务抽象,各云厂商的托管 AI 平台(PAI、TKE/TI、Volcano 引擎 veMLP 等)本质上都是这一层的商业化封装。
3.6 本章心智模型:一张"LLM 上云"的完整分层图
#mermaid-svg-DK5qOAAvYchTMXTI{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-DK5qOAAvYchTMXTI .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-DK5qOAAvYchTMXTI .error-icon{fill:#552222;}#mermaid-svg-DK5qOAAvYchTMXTI .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-DK5qOAAvYchTMXTI .marker{fill:#333333;stroke:#333333;}#mermaid-svg-DK5qOAAvYchTMXTI .marker.cross{stroke:#333333;}#mermaid-svg-DK5qOAAvYchTMXTI svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-DK5qOAAvYchTMXTI p{margin:0;}#mermaid-svg-DK5qOAAvYchTMXTI .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster-label text{fill:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster-label span{color:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster-label span p{background-color:transparent;}#mermaid-svg-DK5qOAAvYchTMXTI .label text,#mermaid-svg-DK5qOAAvYchTMXTI span{fill:#333;color:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .node rect,#mermaid-svg-DK5qOAAvYchTMXTI .node circle,#mermaid-svg-DK5qOAAvYchTMXTI .node ellipse,#mermaid-svg-DK5qOAAvYchTMXTI .node polygon,#mermaid-svg-DK5qOAAvYchTMXTI .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-DK5qOAAvYchTMXTI .rough-node .label text,#mermaid-svg-DK5qOAAvYchTMXTI .node .label text,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape .label,#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape .label{text-anchor:middle;}#mermaid-svg-DK5qOAAvYchTMXTI .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-DK5qOAAvYchTMXTI .rough-node .label,#mermaid-svg-DK5qOAAvYchTMXTI .node .label,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape .label,#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape .label{text-align:center;}#mermaid-svg-DK5qOAAvYchTMXTI .node.clickable{cursor:pointer;}#mermaid-svg-DK5qOAAvYchTMXTI .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-DK5qOAAvYchTMXTI .arrowheadPath{fill:#333333;}#mermaid-svg-DK5qOAAvYchTMXTI .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-DK5qOAAvYchTMXTI .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-DK5qOAAvYchTMXTI .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-DK5qOAAvYchTMXTI .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-DK5qOAAvYchTMXTI .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-DK5qOAAvYchTMXTI .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-DK5qOAAvYchTMXTI .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster text{fill:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster span{color:#333;}#mermaid-svg-DK5qOAAvYchTMXTI div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-DK5qOAAvYchTMXTI .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-DK5qOAAvYchTMXTI rect.text{fill:none;stroke-width:0;}#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape p,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape .label rect,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-DK5qOAAvYchTMXTI .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-DK5qOAAvYchTMXTI .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-DK5qOAAvYchTMXTI :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 模型感知路由 EPP
用户/Agent 请求
AI Gateway / Gateway API + Inference Extension
InferencePool: vLLM/SGLang 副本
Prefill 池
Decode 池
DRA 调度的 GPU 节点池 MIG/共享
Kueue/Volcano 批调度
训练: KubeRay/JobSet/Kubeflow
模型仓库 + 预热/P2P分发
OTel GenAI 观测: token/延迟/缓存命中
四、Agent 是新工作负载:Agent 基础设施的诞生
如果说第三章是"把模型搬上云",本章是 2026 年真正的前沿:"把 Agent 当成云原生公民"。这是当前中文互联网系统性论述最稀缺、而大厂面试已经开始考察的领域。
4.1 核心洞察:Agent 更像"进程",而不是"服务"
Google 在推出 GKE Agent Sandbox 与 Agent Substrate 时,间接承认了一个 K8s 资深从业者心照不宣的事实:Kubernetes 是为"一组固定的、长期运行的、复制的服务"设计的,而 Agent 的行为模式是"海量、短生命周期、大部分时间休眠、事件触发唤醒、执行不可信代码、有会话状态"------这更像操作系统里的进程,而不是数据中心里的服务。
类比展开(这是理解整个 Agent Infra 的钥匙):
| 操作系统进程管理 | Agent 基础设施对应物 |
|---|---|
| 进程创建/销毁 | Sandbox 创建/回收 |
| 休眠与换页(sleep & swap) | Sandbox 休眠(内存快照落盘)、唤醒 |
| fork / checkpoint-restore | Sandbox 克隆(从同一上下文分叉多个 Agent 分支) |
| 进程隔离(虚拟内存/权限) | MicroVM / gVisor / Kata 隔离 |
| 进程调度器 | Agent 调度层(如 Google Agent Substrate,甚至绕过 K8s API Server) |
4.2 运行层:Kubernetes Agent Sandbox------给 Agent 一个"正经的家"
时间线 :KubeCon NA 2025 预览发布 → 2026 年 5 月 20 日 GKE 上正式 GA ,K8s SIG Apps 官方项目 kubernetes-sigs/agent-sandbox 同步成为社区焦点;GA 后不到半年,GKE 上 Sandbox 用量增长 16 倍,LangChain 等框架已在其上运行百万级 Agent 实例。国内方面,阿里云 ACK Agent Sandbox 提供商用实现:MicroVM 级隔离、内存级休眠唤醒、Checkpoint 克隆、每分钟 15,000 个 Sandbox 的弹性创建能力(面向 Agent RL 训练的 rollout 场景)、兼容 E2B SDK 与 AgentScope 等框架。
API 设计(声明式三件套):
SandboxTemplate:平台团队定义的沙箱模板(镜像、运行时、资源、隔离等级)------对应"Golden Path"思想;Sandbox:一个隔离的、有状态的、单例沙箱实例(支持spec.paused休眠与无损恢复);SandboxClaim:消费者的申请接口("给我一个符合模板 X 的沙箱")------Claim 模式与 DRA 的 ResourceClaim、PVC 一脉相承,K8s 的 API 设计哲学在 AI 时代再次复用;WarmPool(预热池):预创建待命沙箱,把分配延迟压到 ~200ms 级,解决"Agent 交互不能等 30 秒冷启动"的体验死穴。
安全模型:Agent 生成的代码默认不可信 → 网络分区隔离(沙箱独立 vSwitch/安全组、禁止访问集群内部组件)、User Namespaces、gVisor/Kata/Firecracker 可插拔隔离、沙箱级审计日志。2026 年多家云厂商的 Agent 平台安全白皮书都把"沙箱逃逸"列为 Agent 安全的头号威胁。
4.3 协议层:MCP 2026-07-28------Agent 的"USB-C"完成云原生化转身
MCP(Model Context Protocol) 由 Anthropic 于 2024 年 11 月开源,统一 LLM 与外部工具/数据源的连接方式,2026 年已是无可争议的事实标准:OpenAI、Google、Microsoft 全线接入;SDK 月下载量超 4 亿次;注册表中 MCP Server 超过 22,000 个。
2026 年 7 月 28 日发布的第 5 版规范是史上最大修订,其核心变化恰恰是"向云原生投降"(褒义):
- 从有状态转向无状态核心 :取消协议级初始化握手与
Mcp-Session-Id,每个请求自包含协议版本、客户端信息与能力;新增可选的server/discover预发现。 - 工程含义 (这是重点,多数文章没讲透):此前 MCP Server 必须在内存/Redis 中维护会话,天然难以水平扩展、难以被普通负载均衡器分发;无状态化后,MCP Server 可以像任何一个无状态微服务一样,被 Deployment + HPA + Gateway API 管理------MCP 基础设施正式落入云原生的标准射程。
- 版本化扩展框架:核心协议保持稳定,交互式界面(MCP Apps)、长时任务(Tasks)等能力通过独立扩展演进------这是 Kubernetes API 组/版本治理模式的翻版。
- 企业级授权强化:面向生产环境的 OAuth 2.0 / OIDC 适配,MCP Server 与企业 IdP 集成。
- 与 A2A(Agent2Agent)协议 (Agent 间通信,Google 发起后捐赠给 Linux Foundation)形成互补:MCP 管"Agent→工具",A2A 管"Agent→Agent",两者共同构成 Agent 互联网协议栈的 TCP/IP 时刻。
必须正视的另一面------MCP 安全 :2026 年 OWASP 为 MCP 单独设立 Top 10 风险清单(继 Web、API、LLM 之后第四次为单一领域立榜);2026 年 4 月安全厂商披露的 MCP SDK 设计级漏洞波及约 1.5 亿次下载、7,000+ 公开服务器,被称为"AI 供应链之母"。工具投毒(tool poisoning)、提示注入经由工具描述传播、过度授权的 OAuth scope、恶意 MCP Server 市场,是 Agent 平台安全设计的四大必答题。这直接催生了下一节的"Agent 网关"。
4.4 治理层:Agent Gateway 与"语义防火墙"
当 Agent 流量(MCP 调用、A2A 通信、模型请求)成为新的东西向/南北向流量,传统 API 网关不够用了。AI Gateway / Agent Gateway 在 2026 年形成明确品类,能力清单:
- 协议转换:OpenAI/Anthropic/Gemini API 互转,一次接入调用所有模型;
- 多模型路由与降级:按成本/延迟/质量路由,故障自动切换(failover);
- token 级治理:按 token 计费的限流、配额、租户分账(传统网关只懂 QPS,AI 网关必须懂 token);
- 语义安全:提示注入检测、敏感数据脱敏、工具调用白名单、输出内容审计;
- 标准实现:Envoy AI Gateway、Istio agentgateway(1.30 实验性引入)、Kong AI Gateway、Higress、阿里云 AI 网关等;底层普遍复用 GIE 的 InferencePool/InferenceModel 标准。
一个值得记住的判断:Agent 时代的"服务网格",治理对象从"服务间调用"变成了"意图与工具调用"。谁掌握了 Agent 流量的语义解析能力,谁就掌握了下一代控制面。
4.5 观测与运维层:AgentOps
Agent 是非确定性系统,传统"看日志重启"彻底失效。2026 年 AgentOps 的标准能力栈:
- Trace 语义化 :基于 OTel GenAI 语义约定,把一次 Agent 任务展开为
agent → task → LLM call / tool call / retrieval的层级 Span 树(Langfuse、Arize Phoenix、LangSmith、各云厂商 APM 均已支持); - 四大新黄金指标:任务成功率(而非请求成功率)、每任务 token 成本、工具调用失败率、人工介入率(human-in-the-loop rate);
- 评估(Evals)进入 CI/CD:Agent 行为回归测试、LLM-as-a-Judge、轨迹(trajectory)回放;
- 审计与合规 :每一次工具调用可追溯到人/租户/权限,这是企业级 Agent 从 Demo 走向生产的准入门槛(2026 年企业选型的首要标准已从"能跑通"变为"可治理、可观测、可审计")。
4.6 本章小结:Agent 基础设施参考架构(2026-09 版)
┌────────────────────────────────────────────────────┐
│ 体验层:对话入口 / IDE / 工作流 │
├────────────────────────────────────────────────────┤
│ 编排层:Agent 框架(LangGraph/AgentScope/ADK...) │
├────────────────────────────────────────────────────┤
│ 协议层:MCP(Agent↔工具,无状态版) A2A(Agent↔Agent) │
├────────────────────────────────────────────────────┤
│ 治理层:Agent Gateway(语义路由/token限流/注入防护) │
├────────────────────────────────────────────────────┤
│ 运行层:Agent Sandbox(MicroVM隔离/WarmPool/休眠克隆) │
├────────────────────────────────────────────────────┤
│ 模型层:Inference Extension + llm-d + vLLM(第三章) │
├────────────────────────────────────────────────────┤
│ 算力层:DRA + GPU池化 + Kueue/Volcano(第三章) │
├────────────────────────────────────────────────────┤
│ 观测层:OTel GenAI + AgentOps + Evals-in-CI/CD │
└────────────────────────────────────────────────────┘
再强调一遍 4.2 的洞察以完成闭环:Agent 的"感知---规划---行动---修正"循环,在结构上就是一个带 LLM 决策器的 Reconcile Loop。云原生用二十年建立起来的声明式哲学,在 Agent 时代获得了语义层面的重生。这不是巧合,而是同构。
五、反向融合:AI 如何改造云原生自身(AIOps → Agentic Ops)
前四章讲"云原生托举 AI",本章讲反方向------这是双向奔赴的另一半。
5.1 AIOps 的三级进化
| 级别 | 能力 | 2026 年成熟度 |
|---|---|---|
| L1 辅助分析 | 异常检测、告警降噪、日志聚类 | 完全成熟,标配 |
| L2 根因推理 | 多模态(指标+日志+链路+事件)联合根因定位、自然语言解释 | 主流平台已生产可用(K8sGPT 及其 CNCF 化、各云厂商智能诊断) |
| L3 自愈闭环 | Agent 自主执行修复动作(扩容、回滚、隔离、改配置) | 谨慎试点期;权限分级 + 审计 + 人工兜底是前提 |
关键工程问题不是"模型行不行",而是给运维 Agent 的权限边界怎么设计------这又回到了第四章的 Sandbox、网关治理与审计能力。你看,整个知识体系在这里闭环了。
5.2 平台工程的对话式转身
2026 年头部公司的内部平台开始出现统一形态:"Chat as the new CLI "。开发者对平台 Agent 说"给我一套带灰度发布和观测的 Redis 环境",Agent 走 Golden Path 模板生成 Crossplane/Helm 声明并 GitOps 提交。平台工程师的角色随之上移:从写模板,到设计"Agent 可安全操作的平台 API 面"。对求职者的含义:会用 K8s 是底线,会设计"给 Agent 用的平台"是溢价。
5.3 AI 辅助研发对基础设施的反压
Copilot 类工具与 CI/CD 深度融合(自动异常检测、修复建议、LLM 生成微服务契约)带来一个容易被忽视的基础设施问题:AI 生成代码的产量远超人工评审带宽,于是 2026 年出现"AI 左移"------在提交阶段用模型做漏洞模式识别与合规推理,安全与评审本身成为需要弹性算力的工作负载。测试环境、沙箱环境的需求被 Agent 化的 CI 放大了数倍(这正是 Agent Sandbox 用量暴涨的另一动因)。
六、深度思考:七个架构判断(截至 2026-09-09)
这一章是本文与"资料汇编型博客"的分水岭。每个判断都给出论据与反方观点,请带着批判性阅读。
判断一:Kubernetes 正在分化为"通用 K8s"与"AI K8s"两个物种,但分化发生在调度器与数据面,而非 API 层。
论据:DRA、GIE、Agent Sandbox 全部以 K8s API 惯例(Claim/Template/Pool)实现,社区刻意保持 API 同构;但 AI 优化调度器需要理解模型加载时间、KV Cache 局部性、尾延迟 SLO,这些是通用调度器永远不会内建的。反方观点:K8s 历来靠"扩展点"消化一切(CSI/CNI 先例),未必分裂。我的结论:API 统一、数据面分裂------就像今天没人觉得 CNI 插件百花齐放算 K8s 分裂。
判断二:Agent 控制面可能"绕开"K8s API Server,这是十年级别的架构悬念。
论据:Google Agent Substrate 直接在 K8s 控制面之外加调度层,因为 etcd + API Server 的写路径为"数千个长生命周期对象"设计,而 Agent 场景是"每分钟上万次的创建/休眠/销毁",对象生命周期以秒计。K8s 的 List-Watch 与乐观锁模型在此量级下会成为瓶颈。推演:Sandbox 类高频对象可能下沉到专用控制面,K8s 退居"资源底座 + 策略面"。求职者注意:这是当前最值得押注的技术空白带。
判断三:推理成本的主战场已从"单卡性能"转移到"系统级缓存分层"。
KV Cache 正在形成"GPU HBM → 主机内存 → 本地 NVMe → 远端存储"的四级分层体系,前缀缓存感知路由(llm-d/GIE 的核心卖点)本质是"让请求去找它的缓存"。未来推理集群的竞争力指标是缓存命中率,而非 FLOPS。这与 CDN 的发展史惊人相似------历史在押韵。
判断四:协议战争基本结束,治理战争刚刚开始。
MCP 赢了工具连接,A2A 占住 Agent 互联,GIE 占住推理路由。2026 年企业选型的核心矛盾从"接不接得上"变成"管不管得住":权限分级、审计、注入防护、供应链安全(MCP 市场里的恶意 Server 就是当年的恶意 npm 包)。OWASP 为 MCP 单独立榜是一个时代信号。
判断五:Serverless 与 Sandbox 正在合流,"函数即服务"的下一形态是"沙箱即服务"。
FaaS 的冷启动优化(快照、预热池)与 Agent Sandbox 的 WarmPool/休眠唤醒是同一套技术在解同一道题。E2B、Daytona 等沙箱云与 Knative/FC 类 Serverless 平台的边界会持续模糊。预测:两年内主流云的 Serverless 产品都会长出"Agent 沙箱"形态。
判断六:国产算力的胜负手在云原生生态位,不在单点性能。
llm-d 于 2026 年 9 月 8 日原生支持沐曦 GPU(首个国产官方加速器)、vLLM 经由 KernelCAT 等工具适配昇腾,说明国产芯片厂商已经想明白了:与其自建私有栈,不如挤进 CNCF 标准栈的加速器列表。对从业者的机会:异构算力适配层(编译器、算子、调度插件)是国产化红利最集中的工程岗位之一。
判断七:可观测性数据的最大消费者将不再是人,而是 Agent。
当 OTel 数据管线接上 LLM,"看板"退化为"证据留存",日常消费形态变成对话与自动行动。这要求遥测数据从"面向人类可视化"转向"面向机器可推理"(结构化、语义约定、上下文完备)------OTel GenAI 语义约定只是这一转向的第一块多米诺。
七、成本视角:GPU FinOps 与推理经济学
大厂面试与晋升答辩中,"懂技术"只值一半,"懂成本"值另一半。给出 2026 年 GPU FinOps 的要点清单:
- 利用率口径要先对齐 :
nvidia-smi的 GPU-Util 是"时间占用率",不反映算力利用;应看 SM 活跃度、显存带宽利用、**MFU(Model FLOPs Utilization,训练)**与 MBU(推理)。面试说出 MFU/MBU 立刻上一个档次。 - 成本公式 (推理):
单 token 成本 ≈ GPU 时租 × 实例数 / (有效吞吐 tokens/s × 3600)。三个杠杆:吞吐(引擎优化、连续批处理)、实例数(PD 分离、弹性、缩容到零)、时租(竞价实例、国产卡、跨区调度)。 - 结构性手段:训练用竞价/抢占实例 + Checkpoint 容错;在线推理保 SLA 用预留;离线批推理(含 Agent RL rollout)填谷。Kueue 的配额借用(borrowing)机制就是为"填谷"设计的。
- 缓存是最大的省钱杠杆:前缀缓存命中一次 ≈ 省掉整个 Prefill 阶段算力;语义缓存(相似问题直接返回)在客服类场景可再省 20-40%(视业务而定)。
- Agent 时代新增成本项 :沙箱机时(休眠策略直接决定账单------这正是 Sandbox
paused/内存级休眠的商业价值)、工具调用费、多 Agent 递归放大效应(一个任务扇出几十个 Agent,成本模型从"每请求"变为"每任务")。FinOps 的核算单元正在从 namespace/服务 变为"任务/租户/Agent"。
八、学习路线图与大厂求职指南
8.1 分水平学习路线
入门(0→1,1-3 个月)
- 用 kind/minikube 搭集群,吃透 Pod/Deployment/Service/Ingress→Gateway API/ConfigMap/PVC 十大对象;
- 理解声明式与 Reconcile Loop(推荐读 kubebuilder 文档 + 手写一个最简 Operator);
- 跑通一个 vLLM 容器 + OpenAI 兼容 API 调用;写一个最简单的 MCP Server;
- 避坑:不要背 YAML,要理解每个字段背后的控制器行为。
进阶(1→3,3-12 个月)
- 调度:DRA 完整 API 族 + Kueue/Volcano 实操;
- 推理:部署 GIE(InferencePool/InferenceModel)+ vLLM,压测并观察 KV Cache 指标;跑一遍 llm-d 或 KServe;
- Agent:部署 kubernetes-sigs/agent-sandbox,理解 Sandbox/Claim/WarmPool;用 OTel GenAI 约定给 Agent 打 trace;
- 网络与观测:Gateway API、Istio ambient、eBPF 观测(Cilium Hubble / DeepFlow);
- 读三个 KEP(K8s 增强提案):DRA、In-Place Resize、GIE------读 KEP 是从使用者到贡献者的分水岭。
资深(3→∞)
- 万卡/千卡集群的 goodput 工程:故障域设计、拓扑感知调度、异步 Checkpoint;
- PD 分离与多级 KV Cache 分层的架构设计与量化收益;
- Agent 控制面的性能边界(etcd 写放大、对象生命周期治理);
- 给 CNCF 项目提 PR(llm-d、agent-sandbox、GIE 都处于早期,贡献者红利巨大);
- 建立自己的"判断力资产":对第 6 章每个判断写出你自己的版本。
8.2 大厂求职:2026 年面试考什么(按岗位)
| 岗位 | 高频考点 | 区分度考点(拉开差距的地方) |
|---|---|---|
| 云原生/基础架构 | K8s 调度与网络原理、Operator、Gateway API | DRA 设计动机、Ingress NGINX 退役后的迁移方案、多集群(Karmada) |
| AI Infra / 异构计算 | vLLM 机制、GPU 共享、训练容错 | PagedAttention 与 OS 虚拟内存类比、PD 分离收益量化、MFU/MBU、llm-d 架构 |
| Agent / AI 应用平台 | MCP、Agent 框架、RAG | MCP 无状态化的工程含义、Sandbox 安全模型、AgentOps 指标体系、注入攻击防御 |
| SRE / 平台工程 | GitOps、OTel、容量管理 | AI 负载的 SLO 设计(TTFT/TPOT)、GPU FinOps、Agentic Ops 权限设计 |
简历建议 :2026 年最具竞争力的项目叙事是完整闭环------"在 K8s 上用 DRA + vLLM + GIE 搭建模型感知路由的推理平台,压测显示 P99 TTFT 下降 X%、GPU 利用率提升 Y%、单 token 成本下降 Z%"。有数字、有标准组件、有成本意识,三件套齐活。切记:只写"熟悉 Kubernetes"已等同于十年前写"熟悉 Windows"。
8.3 一个给所有读者的元建议
这个领域三个月就变一次天(本文所有事实的保质期请自行打折)。不要追逐工具清单,要追逐"问题---约束---权衡"的三元组:LLM 请求为什么需要新路由(问题)、受限于 KV Cache 局部性(约束)、在缓存命中与负载均衡间权衡(trade-off)。工具会死,三元组永生。
九、FAQ 与术语表
Q1:2026 年了,学云原生还来得及吗?会不会被 AI 取代?
来得及且更值钱。AI 没有取代云原生,而是把云原生的版图扩大了一倍(AI Infra + Agent Infra 两个新大陆)。被取代的是"只会 kubectl apply 的操作员",稀缺的是"理解声明式系统如何为 AI 工作负载重新设计"的工程师。
Q2:MCP、A2A、Gateway API Inference Extension 三者什么关系?
分层互补:GIE 解决"请求如何路由到模型副本"(模型层流量);MCP 解决"Agent 如何调用工具/数据"(纵向);A2A 解决"Agent 之间如何协作"(横向)。三者共同构成 Agent 时代的网络协议栈。
Q3:Agent Sandbox 和普通容器/Serverless 函数有什么区别?
三个关键词:不可信代码 (MicroVM 级隔离)、有状态会话 (休眠/唤醒/克隆保上下文)、极低冷启动(WarmPool ~200ms)。普通容器缺第二点,FaaS 缺第一、二点。
Q4:中小团队没有 GPU 集群,怎么参与这个领域?
用云托管推理(按 token 付费)+ 开源标准组件(vLLM、GIE、agent-sandbox 可在 CPU 上用小模型完整实验)。架构认知与协议理解不依赖卡数,面试考察的正是这些。
Q5:本文信息会不会很快过时?
分层看:第一性原理(第 1 章)与判断框架(第 6 章)保质期以年计;具体版本特性(v1.36、MCP 2026-07-28)保质期以季度计,引用前请对照官方 Release Notes 复核。
术语速查表
| 术语 | 一句话解释 |
|---|---|
| DRA | K8s v1.34 GA 的动态资源分配,按属性(而非数量)声明式请求 GPU 等设备 |
| KV Cache | LLM 推理中缓存的注意力键值对,驻留显存,是推理状态与成本的核心 |
| PagedAttention | vLLM 用 OS 分页思想管理 KV Cache,显存利用率提升至 90%+ |
| PD 分离 | Prefill 与 Decode 阶段拆分到不同 GPU 池独立扩缩容 |
| GIE | Gateway API Inference Extension,InferencePool/InferenceModel 模型感知路由标准 |
| llm-d | CNCF 托管的云原生分布式推理项目(Red Hat 发起),实现缓存感知路由与 PD 分离 |
| MCP | Model Context Protocol,Agent↔工具标准协议;2026-07-28 版转向无状态架构 |
| A2A | Agent2Agent 协议,Agent 间互操作标准(Linux Foundation 托管) |
| Agent Sandbox | K8s SIG Apps 项目,为 Agent 提供隔离、有状态、毫秒级分配的运行环境 |
| WarmPool | 预热沙箱池,将沙箱分配延迟压缩至约 200ms |
| OTel GenAI | OpenTelemetry 的生成式 AI 语义约定,标准化 token/模型/Agent 遥测 |
| MFU/MBU | 模型算力利用率(训练)/显存带宽利用率(推理),比 GPU-Util 更真实的指标 |
| Karmada | CNCF 毕业(2026-09)的多集群编排项目,正扩展多集群 AI 调度 |
| Goodput | 有效训练吞吐------扣除故障、重启、等待后的真实算力产出 |
结语:站在两次范式转移的交点上
回看全文,我们其实只讲了一个故事的两幕:
第一幕(2015---2024) ,云原生用声明式 API 和控制回路驯服了分布式系统的复杂性,Kubernetes 成为"数据中心的操作系统";第二幕(2024--- ) ,AI 带着三种前所未有的工作负载------训练、推理、Agent------闯进这座操作系统,逼它长出 DRA、Inference Extension、Agent Sandbox 这些新器官;而最精妙的是,Agent 的"感知---规划---行动"循环与控制回路同构,云原生不仅托举了 AI,还从 AI 身上认出了自己年轻时的样子。
对读者而言,这意味着一个罕见的窗口期:一个成熟领域(云原生)与一个爆发领域(AI Agent)的交点上,知识体系刚刚重写、标准刚刚落定、社区项目刚刚起步(llm-d、agent-sandbox、GIE 都缺贡献者)、岗位 JD 刚刚出现"AI Infra / Agent 平台"字样。此刻入场,你学的不是存量知识,而是未来五年的默认答案。
三个月后本文的部分版本号会过时,但愿你带走的那把尺子------"问题---约束---权衡"------永远锋利。
本文事实信息截止 2026 年 9 月 9 日;引用的社区动态包括:Kubernetes v1.34---v1.36 发布说明、MCP 2026-07-28 规范、GKE Agent Sandbox GA(2026-05)、Karmada CNCF 毕业(2026-09)、llm-d 支持沐曦 GPU(2026-09-08)、Ingress NGINX 退役(2026-03)等。欢迎在评论区指出任何过期信息------在这个领域,纠错本身就是最好的学习。
附:写作说明(GEO 优化要点)
本文按生成式引擎优化(GEO)标准撰写:① 每个核心概念在首次出现处给出可独立引用的显式定义与日期锚点;② 采用问答式小标题与 FAQ 结构,便于 AI 搜索引擎抽取;③ 关键论断均绑定可验证事实(版本号、发布时间、项目归属);④ 术语表提供原子化知识单元;⑤ 分层目录支持按需跳读。转载请注明出处并保持元信息完整。