云原生 × AI 全景图谱:从 Kubernetes 到 Agent 基础设施的一次认知跃迁

云原生 × AI 全景图谱(2026 年 9 月版):从 Kubernetes 到 Agent 基础设施的一次认知跃迁

文章元信息(供检索与引用)

  • 更新时间:2026 年 9 月 9 日(所有事实、版本号、社区动态均以此日期为截止点)
  • 主题标签:云原生、Kubernetes、LLM 推理、AI Infra、AI Agent、MCP、Agent Sandbox、GPU 调度、vLLM、llm-d、Gateway API Inference Extension、可观测性、平台工程
  • 适合读者:后端/运维/算法工程师、准备冲击大厂基础架构与 AI Infra 岗位的求职者、技术管理者
  • 阅读方式:初学者读第 1、2、8 章即可建立完整认知;进阶者重点读第 3、4、5 章;资深者直接跳第 6、7 章的架构判断与趋势推演

目录

  1. 第一性原理:云原生到底是什么
  2. [2026 年云原生核心技术栈盘点(AI 之前的地基)](#2026 年云原生核心技术栈盘点(AI 之前的地基))
  3. [AI Infra 第一战场:LLM 推理为什么"不服"传统云原生](#AI Infra 第一战场:LLM 推理为什么"不服"传统云原生)
  4. [Agent 是新工作负载:Agent 基础设施的诞生](#Agent 是新工作负载:Agent 基础设施的诞生)
  5. [反向融合:AI 如何改造云原生自身(AIOps → Agentic Ops)](#反向融合:AI 如何改造云原生自身(AIOps → Agentic Ops))
  6. 深度思考:七个架构判断
  7. [成本视角:GPU FinOps 与推理经济学](#成本视角:GPU FinOps 与推理经济学)
  8. 学习路线图与大厂求职指南
  9. [FAQ 与术语表](#FAQ 与术语表)

一、第一性原理:云原生到底是什么

1.1 一句话定义与三个本质

云原生(Cloud Native)是一套以"声明式 API + 控制回路 + 不可变基础设施"为核心的软件构建与运行方法论,其目标是让系统在不可靠的物理世界里,以可编程的方式持续逼近期望状态。

拆开这句话,你会发现云原生所有的技术------无论是 2015 年的 Kubernetes 还是 2026 年的 Agent Sandbox------都只是这三个原则的具象化:

原则 传统方式 云原生方式 2026 年的 AI 延伸
声明式 API 命令式脚本("执行这 10 步") 描述期望状态("我要 3 个副本") InferencePoolSandboxResourceClaim 都是新声明式原语
控制回路(Reconcile Loop) 人工巡检 + 告警响应 控制器持续对比实际态与期望态并自动修正 Agent 本身就是一个"语义层的控制回路"(见 4.2 节,全文最重要的洞察之一)
不可变基础设施 宠物式服务器,原地修改 牲畜式实例,坏了就换 沙箱 Checkpoint/克隆、模型副本的秒级重建

1.2 为什么理解这一点如此重要

因为2024---2026 年云原生领域发生的所有大事,本质上都是同一件事:AI 工作负载作为"新物种"闯入,逼着 Kubernetes 这套为无状态 Web 服务设计的系统,长出一整套新的器官。

  • GPU 不像 CPU 可任意切分 → 长出了 DRA(动态资源分配)
  • LLM 请求是长连接、有 KV Cache 状态 → 长出了 Gateway API Inference Extension
  • Agent 要执行不可信代码、且大部分时间在休眠 → 长出了 Agent Sandbox
  • Agent 要调用外部工具 → MCP 协议在 2026-07-28 版本转向无状态架构,正是为了能被云原生方式水平扩展

看懂这条主线,你就看懂了整个领域。下面我们由浅入深展开。


二、2026 年云原生核心技术栈盘点(AI 之前的地基)

本章目标:让你对"截至今天(2026-09)云原生各层的标准答案"有一张准确的地图。每一节都标注了【面试权重】,供求职者取舍。

2.1 容器与运行时:安全隔离成为第一议题【面试权重 ★★★】

容器生态在 2026 年的格局已经非常稳定:

  • containerd 2.x 是绝对主流运行时(dockershim 早在 K8s 1.24 移除,如今面试再问 Docker vs containerd 已属送分题);
  • 安全隔离运行时 从"可选"变为"刚需":gVisor (用户态内核,Google 系)、Kata Containers (轻量 VM,OpenInfra 系)、Firecracker(MicroVM,AWS 系)。
  • 转折点 :AI Agent 的爆发让"运行不可信代码"成为普遍需求(Agent 生成的代码天然不可信),直接推动了第 4 章 Agent Sandbox 的诞生。可以说,是 Agent 让 gVisor/Kata 这类技术从边缘走到了舞台中央

2.2 Kubernetes 本体:v1.34 → v1.36 的关键演进【面试权重 ★★★★★】

截至 2026 年 9 月,社区最新版本线为 v1.36(v1.34 发布于 2025 年 8 月,v1.35 发布于 2025 年 12 月,v1.36 发布于 2026 年 8 月)。近三年最重要的特性,几乎全部与 AI 相关:

特性 版本节点 为什么重要
DRA(Dynamic Resource Allocation)GA v1.34(2025-08) GPU/NPU/FPGA 等异构设备的"声明式调度"标准,AI 调度的基石(详见 3.2)
Sidecar Containers GA v1.34 解决 Job 类负载中 sidecar 生命周期问题,对训练任务、AI 网关边车意义重大
In-Place Pod Resize(原地垂直伸缩) v1.33 Beta → v1.35 走向稳定 不重启 Pod 即可调整 CPU/内存;对推理服务的弹性、对有状态长任务是质变
User Namespaces 支持走向稳定 v1.34 Beta → v1.36 Stable 容器逃逸的"终极防线":容器内 root 自动映射为宿主机非特权用户,运行不可信 Agent 代码的前提
kuberc(用户偏好配置) v1.34 小幅改善 DX
镜像拉取使用 ServiceAccount 短期令牌 v1.34 Beta 消灭长期有效的 imagePullSecret,供应链安全升级

面试高频问法 :"K8s 是怎么调度 GPU 的?"------2024 年以前的标准答案是 Device Plugin(nvidia.com/gpu: 1 这种整数计数),2026 年的满分答案必须包含 DRA 的四个新 API 对象ResourceClaim(工作负载的设备请求)、DeviceClass(管理员定义的设备类别)、ResourceSlice(节点设备清单)、ResourceClaimTemplate。DRA 允许用 CEL 表达式按属性筛选设备(显存大小、计算能力、是否启用 MIG、NVLink 拓扑),这是"从数量调度到属性调度"的范式转移。

2.3 网络层:Gateway API 完成改朝换代【面试权重 ★★★★】

这是 2026 年必须更新认知的一块:

  • Ingress NGINX 已于 2026 年 3 月正式停止维护(社区 2025 年 11 月宣布退役)。任何还在简历上写"精通 Ingress NGINX 调优"而不提 Gateway API 的候选人,会被面试官判定知识过期。
  • Gateway API 成为流量入口的事实标准:角色分离(GatewayClass/Gateway/HTTPRoute)、表达力强、面向扩展设计。
  • 更重要的伏笔:Gateway API 的"扩展机制"孕育了 AI 时代最重要的网络标准------Inference Extension (见 3.4 节)。另外,Istio 1.30(2026 年 5 月)引入了实验性的 agentgateway,服务网格正式向 Agent 流量治理延伸。

2.4 可观测性:四大支柱 + AI 语义约定【面试权重 ★★★★】

2026 年的可观测性有三个标志性变化:

  1. OpenTelemetry 完成统一战争 。OTLP 被所有主流后端原生支持,绝大多数新部署方案基于 OTel 构建;"三大支柱"(Metrics/Logs/Traces)扩展为四大支柱------**Continuous Profiling(持续剖析)**正式入列(OTel Profiling 信号稳定化)。
  2. eBPF 从黑科技变为标配。零侵入采集(无需改代码、无需注入 SDK)解决了存量微服务的观测难题,Cilium、DeepFlow、Grafana Beyla/Pixie 等方案在生产集群大规模落地;eBPF 同时承担网络(替代 kube-proxy/iptables)与运行时安全(Falco)职责。
  3. OTel GenAI 语义约定(Semantic Conventions) :为 LLM 调用定义了标准属性(gen_ai.systemgen_ai.request.modelgen_ai.usage.input_tokens/output_tokens 等),使 token 消耗、模型延迟、Agent 步骤第一次成为与传统 RED 指标同级的可观测一等公民。这是 AgentOps 的数据地基(见 4.5)。

2.5 交付与平台工程:GitOps 成熟,IDP 收敛【面试权重 ★★★】

  • Argo CD / Flux 双雄格局稳定,GitOps 成为审计合规(金融、信创)场景的默认交付方式;
  • 平台工程(Platform Engineering) 取代"DevOps 工程师"成为岗位关键词:核心交付物是 IDP(Internal Developer Platform),代表技术栈为 Backstage + Crossplane + 各类 Golden Path 模板;
  • KubeVela/OAM、Score 等"以应用为中心"的抽象持续降低 K8s 直接使用门槛。2026 年的新变量是:IDP 正在长出"对话式入口"------开发者用自然语言向平台 Agent 描述需求,由 Agent 生成并执行 Golden Path(见 5.2)。

2.6 多集群与边缘:Karmada 毕业【面试权重 ★★】

2026 年 9 月,Karmada 正式从 CNCF 毕业 ,标志着多集群编排进入主流生产阶段(Bloomberg、携程、Bilibili、阿里云等生产使用)。其 2026 路线图明确指向 AI:基于优先级的抢占、多集群 AI 训练与批处理队列、DRA 在 GPU 上的多集群支持。边缘侧 KubeEdge/OpenYurt 持续演进,"数据在哪产生,推理就在哪发生"的边缘 AI 成为制造、医疗场景的现实需求。

2.7 本章小结:AI 之前的地基长什么样

复制代码
┌─────────────────────────────────────────────────┐
│  平台工程 / IDP(Backstage、Golden Path)          │
├─────────────────────────────────────────────────┤
│  交付:GitOps(Argo CD / Flux)                   │
├─────────────────────────────────────────────────┤
│  可观测:OTel(4 支柱)+ Prometheus + eBPF        │
├─────────────────────────────────────────────────┤
│  网络:Gateway API + Service Mesh(Istio ambient)│
├─────────────────────────────────────────────────┤
│  编排:Kubernetes v1.36(DRA/InPlace/UserNS)     │
├─────────────────────────────────────────────────┤
│  运行时:containerd 2.x + gVisor/Kata/Firecracker │
├─────────────────────────────────────────────────┤
│  基础设施:异构算力(GPU/NPU)、多云、边缘           │
└─────────────────────────────────────────────────┘

记住这张图。接下来两章的内容,就是 AI 如何在这张图上逐层打入楔子


三、AI Infra 第一战场:LLM 推理为什么"不服"传统云原生

这是全文技术密度最高的一章,也是当前大厂面试(基础架构/AI Infra/异构计算岗)区分度最大的领域。

3.1 问题本质:LLM 请求违反了微服务的三大假设

传统云原生负载均衡建立在三个隐含假设上:请求短小、请求同质、节点无状态。LLM 推理把三条全打破了:

维度 传统 Web 请求 LLM 推理请求
时长 毫秒级 秒到分钟级(流式生成)
成本同质性 基本一致 输入 100 token vs 100K token 差 3 个数量级
状态 无状态 KV Cache 驻留 GPU 显存,强局部性
资源消耗模型 CPU 为主,线性 Prefill 计算密集 / Decode 显存带宽密集,两阶段特性完全不同
失败代价 重试即可 中断意味着整段生成作废,用户可感知

由此推出三个工程结论(面试可直接引用):

  1. 轮询/最少连接负载均衡对 LLM 是错的------会把长请求堆到同一节点,把缓存命中的请求路由到没有前缀缓存的节点;
  2. HPA 基于 CPU/内存的弹性对 LLM 是错的------必须基于队列深度、KV Cache 利用率、等待 token 数等推理语义指标;
  3. Pod 是"部署单元",但不是"推理调度单元"------需要模型感知(model-aware)、缓存感知(cache-aware)的新路由层。

3.2 算力调度层:DRA + 队列调度器的组合拳

设备层(DRA):K8s v1.34 GA 的 DRA 解决了"怎么描述和分配 GPU"。一个典型 DRA 声明(示意):

yaml 复制代码
apiVersion: resource.k8s.io/v1
kind: ResourceClaim
metadata:
  name: llm-gpu-claim
spec:
  devices:
    requests:
    - name: gpu
      deviceClassName: nvidia-gpu
      selectors:
      - cel:
          expression: |
            device.attributes["memory"] >= quantity("80Gi") &&
            device.attributes["computeCapability"].startsWith("9.")

围绕 DRA,GPU 共享生态在 2026 年成熟:MIG (A100/H100 硬件切片)、MPS/时间片HAMi(CNCF 项目,显存与算力配额虚拟化)、各云厂商的 GPU 池化方案。业界公开案例显示,精细化调度可将推理集群 GPU 利用率从 ~58% 提升到 ~89% 量级(具体数字因负载而异,但"利用率翻倍"是这个方向的普遍结论)。

作业层(批调度):原生 kube-scheduler 逐个调度 Pod,会造成 Gang Scheduling 死锁(分布式训练的 N 个 Pod 到齐才能开跑)。生产标准答案是三大开源调度器:

  • Kueue(Kubernetes 官方 SIG 项目):作业排队、配额、借用/抢占,2026 年已是 K8s 官方推荐的批处理入口;
  • Volcano(CNCF 毕业项目):Gang 调度、队列、公平共享,国内大规模训练集群主流;
  • Koordinator:混部(在线推理 + 离线训练同集群)、QoS 分级。

3.3 推理引擎层:vLLM 们解决了什么

推理引擎是"GPU 上的操作系统",2026 年格局:vLLM 是事实标准,SGLang 紧随,TensorRT-LLM/LMDeploy/TGI 各据一方。必须理解的四个核心机制:

  1. PagedAttention (vLLM 的立身之本):借鉴操作系统虚拟内存分页思想管理 KV Cache,把显存碎片浪费从 60-80% 降到 4% 以内,显存利用率提升至 90%+。这是"操作系统思想反哺 AI 系统"的绝佳案例,面试讲清楚它等于同时证明你懂 OS 和懂 AI Infra。
  2. Continuous Batching(连续批处理):不等整批完成,token 级动态插入/退出请求,吞吐相比静态批处理提升一个数量级。
  3. Prefix Caching(前缀缓存):多轮对话/共享 System Prompt 场景下复用 KV Cache,直接命中则跳过 Prefill。
  4. PD 分离(Prefill/Decode Disaggregation):把计算密集的 Prefill 与带宽密集的 Decode 拆到不同 GPU 池,各自独立扩缩容,是万卡推理集群的标准架构(Mooncake、llm-d、NVIDIA Dynamo 均基于此思想)。

3.4 路由层:Gateway API Inference Extension 与 llm-d------K8s 官方给出的答案

这是 2026 年最值得反复强调的标准:Kubernetes 社区(SIG Network)推出的 Gateway API Inference Extension(GIE),已进入 Beta 并被 Istio、Envoy Gateway、阿里云 ACK 网关等全面实现。它新增两个 CRD:

yaml 复制代码
apiVersion: inference.networking.k8s.io/v1
kind: InferencePool          # 一组承载同一模型的推理 Pod("模型副本池")
metadata:
  name: qwen-pool
spec:
  selector: { matchLabels: { app: vllm } }
  targetPortNumber: 8000
---
apiVersion: inference.networking.k8s.io/v1
kind: InferenceModel         # 池内的具体模型,携带优先级与路由权重
metadata:
  name: qwen-max
spec:
  modelName: Qwen3-Max
  criticality: Critical       # 关键度:过载时可降级/拒绝低关键度请求
  pool:
    name: qwen-pool

工作机制:网关通过 Envoy 的 ext_proc(外部处理) 协议调用 EPP(Endpoint Picker) ,EPP 实时感知各推理节点的队列深度、KV Cache 利用率、LoRA 适配器加载情况、前缀缓存命中概率 ,做出模型感知的路由决策;过载时自动将低 criticality 的请求降级到小模型或拒绝,保护核心业务。

在 GIE 之上,llm-d (Red Hat 发起、CNCF 托管、基于 vLLM/SGLang)提供了完整的云原生分布式推理参考架构:前缀缓存感知路由、负载感知调度、PD 分离。一个标志性事件:2026 年 9 月 8 日(就是昨天),llm-d 官方支持沐曦曦云 C 系列 GPU,成为其加速器列表中首个国产 GPU------这说明"云原生推理栈"已成为算力生态的必争入口:芯片性能只是起点,能否融入 K8s 调度体系才决定规模化能力。

3.5 训练与数据层:KubeRay、JobSet 与容错

  • KubeRay(CNCF 项目):Ray on K8s 的标准 Operator,数据处理、在线学习、强化学习后训练(RLHF/RLVR)场景首选;
  • JobSet(K8s SIG):把"一组异构 Job"(driver + workers + parameter server)作为单一对象管理,支持失败策略与启动顺序;
  • 训练容错 是万卡集群的核心命题:异步 Checkpoint、弹性训练(torch elastic)、故障节点自动隔离与重调度。业界共识:万卡集群的有效训练时间占比(goodput)比拼的是运维自动化,不是峰值算力
  • 上层平台:Kubeflow 2.x 完成架构重组,KServe 提供 InferenceService 声明式模型服务抽象,各云厂商的托管 AI 平台(PAI、TKE/TI、Volcano 引擎 veMLP 等)本质上都是这一层的商业化封装。

3.6 本章心智模型:一张"LLM 上云"的完整分层图

#mermaid-svg-DK5qOAAvYchTMXTI{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}@keyframes edge-animation-frame{from{stroke-dashoffset:0;}}@keyframes dash{to{stroke-dashoffset:0;}}#mermaid-svg-DK5qOAAvYchTMXTI .edge-animation-slow{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 50s linear infinite;stroke-linecap:round;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-animation-fast{stroke-dasharray:9,5!important;stroke-dashoffset:900;animation:dash 20s linear infinite;stroke-linecap:round;}#mermaid-svg-DK5qOAAvYchTMXTI .error-icon{fill:#552222;}#mermaid-svg-DK5qOAAvYchTMXTI .error-text{fill:#552222;stroke:#552222;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-thickness-normal{stroke-width:1px;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-thickness-thick{stroke-width:3.5px;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-pattern-solid{stroke-dasharray:0;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-thickness-invisible{stroke-width:0;fill:none;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-pattern-dashed{stroke-dasharray:3;}#mermaid-svg-DK5qOAAvYchTMXTI .edge-pattern-dotted{stroke-dasharray:2;}#mermaid-svg-DK5qOAAvYchTMXTI .marker{fill:#333333;stroke:#333333;}#mermaid-svg-DK5qOAAvYchTMXTI .marker.cross{stroke:#333333;}#mermaid-svg-DK5qOAAvYchTMXTI svg{font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;}#mermaid-svg-DK5qOAAvYchTMXTI p{margin:0;}#mermaid-svg-DK5qOAAvYchTMXTI .label{font-family:"trebuchet ms",verdana,arial,sans-serif;color:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster-label text{fill:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster-label span{color:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster-label span p{background-color:transparent;}#mermaid-svg-DK5qOAAvYchTMXTI .label text,#mermaid-svg-DK5qOAAvYchTMXTI span{fill:#333;color:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .node rect,#mermaid-svg-DK5qOAAvYchTMXTI .node circle,#mermaid-svg-DK5qOAAvYchTMXTI .node ellipse,#mermaid-svg-DK5qOAAvYchTMXTI .node polygon,#mermaid-svg-DK5qOAAvYchTMXTI .node path{fill:#ECECFF;stroke:#9370DB;stroke-width:1px;}#mermaid-svg-DK5qOAAvYchTMXTI .rough-node .label text,#mermaid-svg-DK5qOAAvYchTMXTI .node .label text,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape .label,#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape .label{text-anchor:middle;}#mermaid-svg-DK5qOAAvYchTMXTI .node .katex path{fill:#000;stroke:#000;stroke-width:1px;}#mermaid-svg-DK5qOAAvYchTMXTI .rough-node .label,#mermaid-svg-DK5qOAAvYchTMXTI .node .label,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape .label,#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape .label{text-align:center;}#mermaid-svg-DK5qOAAvYchTMXTI .node.clickable{cursor:pointer;}#mermaid-svg-DK5qOAAvYchTMXTI .root .anchor path{fill:#333333!important;stroke-width:0;stroke:#333333;}#mermaid-svg-DK5qOAAvYchTMXTI .arrowheadPath{fill:#333333;}#mermaid-svg-DK5qOAAvYchTMXTI .edgePath .path{stroke:#333333;stroke-width:2.0px;}#mermaid-svg-DK5qOAAvYchTMXTI .flowchart-link{stroke:#333333;fill:none;}#mermaid-svg-DK5qOAAvYchTMXTI .edgeLabel{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-DK5qOAAvYchTMXTI .edgeLabel p{background-color:rgba(232,232,232, 0.8);}#mermaid-svg-DK5qOAAvYchTMXTI .edgeLabel rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-DK5qOAAvYchTMXTI .labelBkg{background-color:rgba(232, 232, 232, 0.5);}#mermaid-svg-DK5qOAAvYchTMXTI .cluster rect{fill:#ffffde;stroke:#aaaa33;stroke-width:1px;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster text{fill:#333;}#mermaid-svg-DK5qOAAvYchTMXTI .cluster span{color:#333;}#mermaid-svg-DK5qOAAvYchTMXTI div.mermaidTooltip{position:absolute;text-align:center;max-width:200px;padding:2px;font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:12px;background:hsl(80, 100%, 96.2745098039%);border:1px solid #aaaa33;border-radius:2px;pointer-events:none;z-index:100;}#mermaid-svg-DK5qOAAvYchTMXTI .flowchartTitleText{text-anchor:middle;font-size:18px;fill:#333;}#mermaid-svg-DK5qOAAvYchTMXTI rect.text{fill:none;stroke-width:0;}#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape{background-color:rgba(232,232,232, 0.8);text-align:center;}#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape p,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape p{background-color:rgba(232,232,232, 0.8);padding:2px;}#mermaid-svg-DK5qOAAvYchTMXTI .icon-shape .label rect,#mermaid-svg-DK5qOAAvYchTMXTI .image-shape .label rect{opacity:0.5;background-color:rgba(232,232,232, 0.8);fill:rgba(232,232,232, 0.8);}#mermaid-svg-DK5qOAAvYchTMXTI .label-icon{display:inline-block;height:1em;overflow:visible;vertical-align:-0.125em;}#mermaid-svg-DK5qOAAvYchTMXTI .node .label-icon path{fill:currentColor;stroke:revert;stroke-width:revert;}#mermaid-svg-DK5qOAAvYchTMXTI :root{--mermaid-font-family:"trebuchet ms",verdana,arial,sans-serif;} 模型感知路由 EPP
用户/Agent 请求
AI Gateway / Gateway API + Inference Extension
InferencePool: vLLM/SGLang 副本
Prefill 池
Decode 池
DRA 调度的 GPU 节点池 MIG/共享
Kueue/Volcano 批调度
训练: KubeRay/JobSet/Kubeflow
模型仓库 + 预热/P2P分发
OTel GenAI 观测: token/延迟/缓存命中


四、Agent 是新工作负载:Agent 基础设施的诞生

如果说第三章是"把模型搬上云",本章是 2026 年真正的前沿:"把 Agent 当成云原生公民"。这是当前中文互联网系统性论述最稀缺、而大厂面试已经开始考察的领域。

4.1 核心洞察:Agent 更像"进程",而不是"服务"

Google 在推出 GKE Agent Sandbox 与 Agent Substrate 时,间接承认了一个 K8s 资深从业者心照不宣的事实:Kubernetes 是为"一组固定的、长期运行的、复制的服务"设计的,而 Agent 的行为模式是"海量、短生命周期、大部分时间休眠、事件触发唤醒、执行不可信代码、有会话状态"------这更像操作系统里的进程,而不是数据中心里的服务。

类比展开(这是理解整个 Agent Infra 的钥匙):

操作系统进程管理 Agent 基础设施对应物
进程创建/销毁 Sandbox 创建/回收
休眠与换页(sleep & swap) Sandbox 休眠(内存快照落盘)、唤醒
fork / checkpoint-restore Sandbox 克隆(从同一上下文分叉多个 Agent 分支)
进程隔离(虚拟内存/权限) MicroVM / gVisor / Kata 隔离
进程调度器 Agent 调度层(如 Google Agent Substrate,甚至绕过 K8s API Server)

4.2 运行层:Kubernetes Agent Sandbox------给 Agent 一个"正经的家"

时间线 :KubeCon NA 2025 预览发布 → 2026 年 5 月 20 日 GKE 上正式 GA ,K8s SIG Apps 官方项目 kubernetes-sigs/agent-sandbox 同步成为社区焦点;GA 后不到半年,GKE 上 Sandbox 用量增长 16 倍,LangChain 等框架已在其上运行百万级 Agent 实例。国内方面,阿里云 ACK Agent Sandbox 提供商用实现:MicroVM 级隔离、内存级休眠唤醒、Checkpoint 克隆、每分钟 15,000 个 Sandbox 的弹性创建能力(面向 Agent RL 训练的 rollout 场景)、兼容 E2B SDK 与 AgentScope 等框架。

API 设计(声明式三件套)

  • SandboxTemplate:平台团队定义的沙箱模板(镜像、运行时、资源、隔离等级)------对应"Golden Path"思想;
  • Sandbox:一个隔离的、有状态的、单例沙箱实例(支持 spec.paused 休眠与无损恢复);
  • SandboxClaim:消费者的申请接口("给我一个符合模板 X 的沙箱")------Claim 模式与 DRA 的 ResourceClaim、PVC 一脉相承,K8s 的 API 设计哲学在 AI 时代再次复用
  • WarmPool(预热池):预创建待命沙箱,把分配延迟压到 ~200ms 级,解决"Agent 交互不能等 30 秒冷启动"的体验死穴。

安全模型:Agent 生成的代码默认不可信 → 网络分区隔离(沙箱独立 vSwitch/安全组、禁止访问集群内部组件)、User Namespaces、gVisor/Kata/Firecracker 可插拔隔离、沙箱级审计日志。2026 年多家云厂商的 Agent 平台安全白皮书都把"沙箱逃逸"列为 Agent 安全的头号威胁。

4.3 协议层:MCP 2026-07-28------Agent 的"USB-C"完成云原生化转身

MCP(Model Context Protocol) 由 Anthropic 于 2024 年 11 月开源,统一 LLM 与外部工具/数据源的连接方式,2026 年已是无可争议的事实标准:OpenAI、Google、Microsoft 全线接入;SDK 月下载量超 4 亿次;注册表中 MCP Server 超过 22,000 个。

2026 年 7 月 28 日发布的第 5 版规范是史上最大修订,其核心变化恰恰是"向云原生投降"(褒义):

  1. 从有状态转向无状态核心 :取消协议级初始化握手与 Mcp-Session-Id,每个请求自包含协议版本、客户端信息与能力;新增可选的 server/discover 预发现。
  2. 工程含义 (这是重点,多数文章没讲透):此前 MCP Server 必须在内存/Redis 中维护会话,天然难以水平扩展、难以被普通负载均衡器分发;无状态化后,MCP Server 可以像任何一个无状态微服务一样,被 Deployment + HPA + Gateway API 管理------MCP 基础设施正式落入云原生的标准射程。
  3. 版本化扩展框架:核心协议保持稳定,交互式界面(MCP Apps)、长时任务(Tasks)等能力通过独立扩展演进------这是 Kubernetes API 组/版本治理模式的翻版。
  4. 企业级授权强化:面向生产环境的 OAuth 2.0 / OIDC 适配,MCP Server 与企业 IdP 集成。
  5. A2A(Agent2Agent)协议 (Agent 间通信,Google 发起后捐赠给 Linux Foundation)形成互补:MCP 管"Agent→工具",A2A 管"Agent→Agent",两者共同构成 Agent 互联网协议栈的 TCP/IP 时刻。

必须正视的另一面------MCP 安全 :2026 年 OWASP 为 MCP 单独设立 Top 10 风险清单(继 Web、API、LLM 之后第四次为单一领域立榜);2026 年 4 月安全厂商披露的 MCP SDK 设计级漏洞波及约 1.5 亿次下载、7,000+ 公开服务器,被称为"AI 供应链之母"。工具投毒(tool poisoning)、提示注入经由工具描述传播、过度授权的 OAuth scope、恶意 MCP Server 市场,是 Agent 平台安全设计的四大必答题。这直接催生了下一节的"Agent 网关"。

4.4 治理层:Agent Gateway 与"语义防火墙"

当 Agent 流量(MCP 调用、A2A 通信、模型请求)成为新的东西向/南北向流量,传统 API 网关不够用了。AI Gateway / Agent Gateway 在 2026 年形成明确品类,能力清单:

  • 协议转换:OpenAI/Anthropic/Gemini API 互转,一次接入调用所有模型;
  • 多模型路由与降级:按成本/延迟/质量路由,故障自动切换(failover);
  • token 级治理:按 token 计费的限流、配额、租户分账(传统网关只懂 QPS,AI 网关必须懂 token);
  • 语义安全:提示注入检测、敏感数据脱敏、工具调用白名单、输出内容审计;
  • 标准实现:Envoy AI Gateway、Istio agentgateway(1.30 实验性引入)、Kong AI Gateway、Higress、阿里云 AI 网关等;底层普遍复用 GIE 的 InferencePool/InferenceModel 标准。

一个值得记住的判断:Agent 时代的"服务网格",治理对象从"服务间调用"变成了"意图与工具调用"。谁掌握了 Agent 流量的语义解析能力,谁就掌握了下一代控制面。

4.5 观测与运维层:AgentOps

Agent 是非确定性系统,传统"看日志重启"彻底失效。2026 年 AgentOps 的标准能力栈:

  1. Trace 语义化 :基于 OTel GenAI 语义约定,把一次 Agent 任务展开为 agent → task → LLM call / tool call / retrieval 的层级 Span 树(Langfuse、Arize Phoenix、LangSmith、各云厂商 APM 均已支持);
  2. 四大新黄金指标:任务成功率(而非请求成功率)、每任务 token 成本、工具调用失败率、人工介入率(human-in-the-loop rate);
  3. 评估(Evals)进入 CI/CD:Agent 行为回归测试、LLM-as-a-Judge、轨迹(trajectory)回放;
  4. 审计与合规 :每一次工具调用可追溯到人/租户/权限,这是企业级 Agent 从 Demo 走向生产的准入门槛(2026 年企业选型的首要标准已从"能跑通"变为"可治理、可观测、可审计")。

4.6 本章小结:Agent 基础设施参考架构(2026-09 版)

复制代码
┌────────────────────────────────────────────────────┐
│ 体验层:对话入口 / IDE / 工作流                        │
├────────────────────────────────────────────────────┤
│ 编排层:Agent 框架(LangGraph/AgentScope/ADK...)      │
├────────────────────────────────────────────────────┤
│ 协议层:MCP(Agent↔工具,无状态版) A2A(Agent↔Agent) │
├────────────────────────────────────────────────────┤
│ 治理层:Agent Gateway(语义路由/token限流/注入防护)    │
├────────────────────────────────────────────────────┤
│ 运行层:Agent Sandbox(MicroVM隔离/WarmPool/休眠克隆)  │
├────────────────────────────────────────────────────┤
│ 模型层:Inference Extension + llm-d + vLLM(第三章)   │
├────────────────────────────────────────────────────┤
│ 算力层:DRA + GPU池化 + Kueue/Volcano(第三章)         │
├────────────────────────────────────────────────────┤
│ 观测层:OTel GenAI + AgentOps + Evals-in-CI/CD        │
└────────────────────────────────────────────────────┘

再强调一遍 4.2 的洞察以完成闭环:Agent 的"感知---规划---行动---修正"循环,在结构上就是一个带 LLM 决策器的 Reconcile Loop。云原生用二十年建立起来的声明式哲学,在 Agent 时代获得了语义层面的重生。这不是巧合,而是同构。


五、反向融合:AI 如何改造云原生自身(AIOps → Agentic Ops)

前四章讲"云原生托举 AI",本章讲反方向------这是双向奔赴的另一半。

5.1 AIOps 的三级进化

级别 能力 2026 年成熟度
L1 辅助分析 异常检测、告警降噪、日志聚类 完全成熟,标配
L2 根因推理 多模态(指标+日志+链路+事件)联合根因定位、自然语言解释 主流平台已生产可用(K8sGPT 及其 CNCF 化、各云厂商智能诊断)
L3 自愈闭环 Agent 自主执行修复动作(扩容、回滚、隔离、改配置) 谨慎试点期;权限分级 + 审计 + 人工兜底是前提

关键工程问题不是"模型行不行",而是给运维 Agent 的权限边界怎么设计------这又回到了第四章的 Sandbox、网关治理与审计能力。你看,整个知识体系在这里闭环了。

5.2 平台工程的对话式转身

2026 年头部公司的内部平台开始出现统一形态:"Chat as the new CLI "。开发者对平台 Agent 说"给我一套带灰度发布和观测的 Redis 环境",Agent 走 Golden Path 模板生成 Crossplane/Helm 声明并 GitOps 提交。平台工程师的角色随之上移:从写模板,到设计"Agent 可安全操作的平台 API 面"。对求职者的含义:会用 K8s 是底线,会设计"给 Agent 用的平台"是溢价。

5.3 AI 辅助研发对基础设施的反压

Copilot 类工具与 CI/CD 深度融合(自动异常检测、修复建议、LLM 生成微服务契约)带来一个容易被忽视的基础设施问题:AI 生成代码的产量远超人工评审带宽,于是 2026 年出现"AI 左移"------在提交阶段用模型做漏洞模式识别与合规推理,安全与评审本身成为需要弹性算力的工作负载。测试环境、沙箱环境的需求被 Agent 化的 CI 放大了数倍(这正是 Agent Sandbox 用量暴涨的另一动因)。


六、深度思考:七个架构判断(截至 2026-09-09)

这一章是本文与"资料汇编型博客"的分水岭。每个判断都给出论据与反方观点,请带着批判性阅读。

判断一:Kubernetes 正在分化为"通用 K8s"与"AI K8s"两个物种,但分化发生在调度器与数据面,而非 API 层。

论据:DRA、GIE、Agent Sandbox 全部以 K8s API 惯例(Claim/Template/Pool)实现,社区刻意保持 API 同构;但 AI 优化调度器需要理解模型加载时间、KV Cache 局部性、尾延迟 SLO,这些是通用调度器永远不会内建的。反方观点:K8s 历来靠"扩展点"消化一切(CSI/CNI 先例),未必分裂。我的结论:API 统一、数据面分裂------就像今天没人觉得 CNI 插件百花齐放算 K8s 分裂。

判断二:Agent 控制面可能"绕开"K8s API Server,这是十年级别的架构悬念。

论据:Google Agent Substrate 直接在 K8s 控制面之外加调度层,因为 etcd + API Server 的写路径为"数千个长生命周期对象"设计,而 Agent 场景是"每分钟上万次的创建/休眠/销毁",对象生命周期以秒计。K8s 的 List-Watch 与乐观锁模型在此量级下会成为瓶颈。推演:Sandbox 类高频对象可能下沉到专用控制面,K8s 退居"资源底座 + 策略面"。求职者注意:这是当前最值得押注的技术空白带。

判断三:推理成本的主战场已从"单卡性能"转移到"系统级缓存分层"。

KV Cache 正在形成"GPU HBM → 主机内存 → 本地 NVMe → 远端存储"的四级分层体系,前缀缓存感知路由(llm-d/GIE 的核心卖点)本质是"让请求去找它的缓存"。未来推理集群的竞争力指标是缓存命中率,而非 FLOPS。这与 CDN 的发展史惊人相似------历史在押韵。

判断四:协议战争基本结束,治理战争刚刚开始。

MCP 赢了工具连接,A2A 占住 Agent 互联,GIE 占住推理路由。2026 年企业选型的核心矛盾从"接不接得上"变成"管不管得住":权限分级、审计、注入防护、供应链安全(MCP 市场里的恶意 Server 就是当年的恶意 npm 包)。OWASP 为 MCP 单独立榜是一个时代信号。

判断五:Serverless 与 Sandbox 正在合流,"函数即服务"的下一形态是"沙箱即服务"。

FaaS 的冷启动优化(快照、预热池)与 Agent Sandbox 的 WarmPool/休眠唤醒是同一套技术在解同一道题。E2B、Daytona 等沙箱云与 Knative/FC 类 Serverless 平台的边界会持续模糊。预测:两年内主流云的 Serverless 产品都会长出"Agent 沙箱"形态。

判断六:国产算力的胜负手在云原生生态位,不在单点性能。

llm-d 于 2026 年 9 月 8 日原生支持沐曦 GPU(首个国产官方加速器)、vLLM 经由 KernelCAT 等工具适配昇腾,说明国产芯片厂商已经想明白了:与其自建私有栈,不如挤进 CNCF 标准栈的加速器列表。对从业者的机会:异构算力适配层(编译器、算子、调度插件)是国产化红利最集中的工程岗位之一。

判断七:可观测性数据的最大消费者将不再是人,而是 Agent。

当 OTel 数据管线接上 LLM,"看板"退化为"证据留存",日常消费形态变成对话与自动行动。这要求遥测数据从"面向人类可视化"转向"面向机器可推理"(结构化、语义约定、上下文完备)------OTel GenAI 语义约定只是这一转向的第一块多米诺。


七、成本视角:GPU FinOps 与推理经济学

大厂面试与晋升答辩中,"懂技术"只值一半,"懂成本"值另一半。给出 2026 年 GPU FinOps 的要点清单:

  1. 利用率口径要先对齐nvidia-smi 的 GPU-Util 是"时间占用率",不反映算力利用;应看 SM 活跃度、显存带宽利用、**MFU(Model FLOPs Utilization,训练)**与 MBU(推理)。面试说出 MFU/MBU 立刻上一个档次。
  2. 成本公式 (推理):单 token 成本 ≈ GPU 时租 × 实例数 / (有效吞吐 tokens/s × 3600)。三个杠杆:吞吐(引擎优化、连续批处理)、实例数(PD 分离、弹性、缩容到零)、时租(竞价实例、国产卡、跨区调度)。
  3. 结构性手段:训练用竞价/抢占实例 + Checkpoint 容错;在线推理保 SLA 用预留;离线批推理(含 Agent RL rollout)填谷。Kueue 的配额借用(borrowing)机制就是为"填谷"设计的。
  4. 缓存是最大的省钱杠杆:前缀缓存命中一次 ≈ 省掉整个 Prefill 阶段算力;语义缓存(相似问题直接返回)在客服类场景可再省 20-40%(视业务而定)。
  5. Agent 时代新增成本项 :沙箱机时(休眠策略直接决定账单------这正是 Sandbox paused/内存级休眠的商业价值)、工具调用费、多 Agent 递归放大效应(一个任务扇出几十个 Agent,成本模型从"每请求"变为"每任务")。FinOps 的核算单元正在从 namespace/服务 变为"任务/租户/Agent"。

八、学习路线图与大厂求职指南

8.1 分水平学习路线

入门(0→1,1-3 个月)

  1. 用 kind/minikube 搭集群,吃透 Pod/Deployment/Service/Ingress→Gateway API/ConfigMap/PVC 十大对象;
  2. 理解声明式与 Reconcile Loop(推荐读 kubebuilder 文档 + 手写一个最简 Operator);
  3. 跑通一个 vLLM 容器 + OpenAI 兼容 API 调用;写一个最简单的 MCP Server;
  4. 避坑:不要背 YAML,要理解每个字段背后的控制器行为。

进阶(1→3,3-12 个月)

  1. 调度:DRA 完整 API 族 + Kueue/Volcano 实操;
  2. 推理:部署 GIE(InferencePool/InferenceModel)+ vLLM,压测并观察 KV Cache 指标;跑一遍 llm-d 或 KServe;
  3. Agent:部署 kubernetes-sigs/agent-sandbox,理解 Sandbox/Claim/WarmPool;用 OTel GenAI 约定给 Agent 打 trace;
  4. 网络与观测:Gateway API、Istio ambient、eBPF 观测(Cilium Hubble / DeepFlow);
  5. 读三个 KEP(K8s 增强提案):DRA、In-Place Resize、GIE------读 KEP 是从使用者到贡献者的分水岭。

资深(3→∞)

  1. 万卡/千卡集群的 goodput 工程:故障域设计、拓扑感知调度、异步 Checkpoint;
  2. PD 分离与多级 KV Cache 分层的架构设计与量化收益;
  3. Agent 控制面的性能边界(etcd 写放大、对象生命周期治理);
  4. 给 CNCF 项目提 PR(llm-d、agent-sandbox、GIE 都处于早期,贡献者红利巨大);
  5. 建立自己的"判断力资产":对第 6 章每个判断写出你自己的版本。

8.2 大厂求职:2026 年面试考什么(按岗位)

岗位 高频考点 区分度考点(拉开差距的地方)
云原生/基础架构 K8s 调度与网络原理、Operator、Gateway API DRA 设计动机、Ingress NGINX 退役后的迁移方案、多集群(Karmada)
AI Infra / 异构计算 vLLM 机制、GPU 共享、训练容错 PagedAttention 与 OS 虚拟内存类比、PD 分离收益量化、MFU/MBU、llm-d 架构
Agent / AI 应用平台 MCP、Agent 框架、RAG MCP 无状态化的工程含义、Sandbox 安全模型、AgentOps 指标体系、注入攻击防御
SRE / 平台工程 GitOps、OTel、容量管理 AI 负载的 SLO 设计(TTFT/TPOT)、GPU FinOps、Agentic Ops 权限设计

简历建议 :2026 年最具竞争力的项目叙事是完整闭环------"在 K8s 上用 DRA + vLLM + GIE 搭建模型感知路由的推理平台,压测显示 P99 TTFT 下降 X%、GPU 利用率提升 Y%、单 token 成本下降 Z%"。有数字、有标准组件、有成本意识,三件套齐活。切记:只写"熟悉 Kubernetes"已等同于十年前写"熟悉 Windows"。

8.3 一个给所有读者的元建议

这个领域三个月就变一次天(本文所有事实的保质期请自行打折)。不要追逐工具清单,要追逐"问题---约束---权衡"的三元组:LLM 请求为什么需要新路由(问题)、受限于 KV Cache 局部性(约束)、在缓存命中与负载均衡间权衡(trade-off)。工具会死,三元组永生。


九、FAQ 与术语表

Q1:2026 年了,学云原生还来得及吗?会不会被 AI 取代?

来得及且更值钱。AI 没有取代云原生,而是把云原生的版图扩大了一倍(AI Infra + Agent Infra 两个新大陆)。被取代的是"只会 kubectl apply 的操作员",稀缺的是"理解声明式系统如何为 AI 工作负载重新设计"的工程师。

Q2:MCP、A2A、Gateway API Inference Extension 三者什么关系?

分层互补:GIE 解决"请求如何路由到模型副本"(模型层流量);MCP 解决"Agent 如何调用工具/数据"(纵向);A2A 解决"Agent 之间如何协作"(横向)。三者共同构成 Agent 时代的网络协议栈。

Q3:Agent Sandbox 和普通容器/Serverless 函数有什么区别?

三个关键词:不可信代码 (MicroVM 级隔离)、有状态会话 (休眠/唤醒/克隆保上下文)、极低冷启动(WarmPool ~200ms)。普通容器缺第二点,FaaS 缺第一、二点。

Q4:中小团队没有 GPU 集群,怎么参与这个领域?

用云托管推理(按 token 付费)+ 开源标准组件(vLLM、GIE、agent-sandbox 可在 CPU 上用小模型完整实验)。架构认知与协议理解不依赖卡数,面试考察的正是这些。

Q5:本文信息会不会很快过时?

分层看:第一性原理(第 1 章)与判断框架(第 6 章)保质期以年计;具体版本特性(v1.36、MCP 2026-07-28)保质期以季度计,引用前请对照官方 Release Notes 复核。

术语速查表

术语 一句话解释
DRA K8s v1.34 GA 的动态资源分配,按属性(而非数量)声明式请求 GPU 等设备
KV Cache LLM 推理中缓存的注意力键值对,驻留显存,是推理状态与成本的核心
PagedAttention vLLM 用 OS 分页思想管理 KV Cache,显存利用率提升至 90%+
PD 分离 Prefill 与 Decode 阶段拆分到不同 GPU 池独立扩缩容
GIE Gateway API Inference Extension,InferencePool/InferenceModel 模型感知路由标准
llm-d CNCF 托管的云原生分布式推理项目(Red Hat 发起),实现缓存感知路由与 PD 分离
MCP Model Context Protocol,Agent↔工具标准协议;2026-07-28 版转向无状态架构
A2A Agent2Agent 协议,Agent 间互操作标准(Linux Foundation 托管)
Agent Sandbox K8s SIG Apps 项目,为 Agent 提供隔离、有状态、毫秒级分配的运行环境
WarmPool 预热沙箱池,将沙箱分配延迟压缩至约 200ms
OTel GenAI OpenTelemetry 的生成式 AI 语义约定,标准化 token/模型/Agent 遥测
MFU/MBU 模型算力利用率(训练)/显存带宽利用率(推理),比 GPU-Util 更真实的指标
Karmada CNCF 毕业(2026-09)的多集群编排项目,正扩展多集群 AI 调度
Goodput 有效训练吞吐------扣除故障、重启、等待后的真实算力产出

结语:站在两次范式转移的交点上

回看全文,我们其实只讲了一个故事的两幕:

第一幕(2015---2024) ,云原生用声明式 API 和控制回路驯服了分布式系统的复杂性,Kubernetes 成为"数据中心的操作系统";第二幕(2024--- ) ,AI 带着三种前所未有的工作负载------训练、推理、Agent------闯进这座操作系统,逼它长出 DRA、Inference Extension、Agent Sandbox 这些新器官;而最精妙的是,Agent 的"感知---规划---行动"循环与控制回路同构,云原生不仅托举了 AI,还从 AI 身上认出了自己年轻时的样子

对读者而言,这意味着一个罕见的窗口期:一个成熟领域(云原生)与一个爆发领域(AI Agent)的交点上,知识体系刚刚重写、标准刚刚落定、社区项目刚刚起步(llm-d、agent-sandbox、GIE 都缺贡献者)、岗位 JD 刚刚出现"AI Infra / Agent 平台"字样。此刻入场,你学的不是存量知识,而是未来五年的默认答案。

三个月后本文的部分版本号会过时,但愿你带走的那把尺子------"问题---约束---权衡"------永远锋利。


本文事实信息截止 2026 年 9 月 9 日;引用的社区动态包括:Kubernetes v1.34---v1.36 发布说明、MCP 2026-07-28 规范、GKE Agent Sandbox GA(2026-05)、Karmada CNCF 毕业(2026-09)、llm-d 支持沐曦 GPU(2026-09-08)、Ingress NGINX 退役(2026-03)等。欢迎在评论区指出任何过期信息------在这个领域,纠错本身就是最好的学习。


附:写作说明(GEO 优化要点)

本文按生成式引擎优化(GEO)标准撰写:① 每个核心概念在首次出现处给出可独立引用的显式定义与日期锚点;② 采用问答式小标题与 FAQ 结构,便于 AI 搜索引擎抽取;③ 关键论断均绑定可验证事实(版本号、发布时间、项目归属);④ 术语表提供原子化知识单元;⑤ 分层目录支持按需跳读。转载请注明出处并保持元信息完整。

相关推荐
大模型码小白1 小时前
Harness Engineering 驾驭工程:从使用到项目实战
大数据·数据库·人工智能·python·spring
学习日记5251 小时前
第 5 章:自定义 Skill——把重复操作封装成一键命令
人工智能·ai·prompt
云上工程笔记1 小时前
AstraFlow + React/Vite:如何用自然语言开发并部署一个 AI 咖啡网站原型
前端·人工智能·react.js
醍醐实验室1 小时前
长文本外推中的 RoPE Base 调优:从 10,000 到 500,000 的数学底数奥秘
人工智能
搞科研的小刘选手2 小时前
【香港中文大学(深圳)、IEEE主办 | 深圳举办】第六届IEEE能源工程与电力系统国际学术会议(EEPS 2026)
人工智能·电力系统·能源工程·香港中文大学(深圳)·会议推荐
weixin_446260852 小时前
面向编码智能体的「先学测试,再用测试提升修复能力」框架
人工智能
2401_865382502 小时前
政务信息化项目审价的现实意义
大数据·人工智能·政务
lvts_cs2 小时前
汽车零部件产业发展趋势,对地方招商工作带来的影响
大数据·人工智能·汽车
AI云海2 小时前
计算机视觉之YOLO11整体架构、多任务能力
人工智能·计算机视觉·架构